Die Knappheit 2026: Was passiert ist und warum
Die GPU-Compute-Knappheit, die Ende 2022 begann, ist nicht beendet. Sie hat sich weiterentwickelt. Im Jahr 2026 ist der Engpass nicht mehr die GPU-Chip-Fertigung — NVIDIA und TSMC haben die Produktion deutlich gesteigert. Der Engpass hat sich stromaufwärts zum Speicher verlagert: konkret zu High Bandwidth Memory (HBM), dem spezialisierten DRAM, den jeder moderne AI-Beschleuniger benötigt.
Die Knappheit resultiert aus der Kollision zweier Kräfte:
Explodierende AI-Nachfrage. Hyperscaler (Microsoft, Google, Amazon, Meta), souveräne AI-Programme und Enterprise-Deployments bestellen zusammen Millionen von AI-Beschleunigern pro Jahr. Jede H100 benötigt 80 GB HBM3, und jede Blackwell B200 benötigt 192 GB HBM3e. Die gesamte HBM-Nachfrage ist zwischen 2023 und 2026 um das 5-Fache gewachsen.
Begrenzte Speicherversorgung. HBM wird von nur drei Unternehmen hergestellt — SK Hynix, Samsung und Micron — unter Verwendung spezialisierter Prozesse, die nicht schnell hochgefahren werden können. Die HBM-Produktion erfordert 2-3x mehr Siliziumfläche pro Gigabyte als Standard-DRAM, nutzt Advanced Packaging (Die-Stacking mit Through-Silicon Vias) und hat niedrigere Fertigungsausbeuten.
Das Ergebnis: Das Nachfragewachstum hat die Angebotsausweitung weit übertroffen und eine Knappheit geschaffen, die Speicherhersteller als die längste in der Geschichte der Branche beschreiben.
HBM: Der Speicherengpass hinter der GPU-Krise
Was HBM anders macht
HBM ist kein gewöhnlicher Speicher. Er liefert die extreme Bandbreite, die AI-Beschleuniger benötigen, um Daten an Tausende von Rechenkernen zu speisen. Das Verständnis der technischen Unterschiede erklärt, warum das Angebot nicht einfach skaliert werden kann:
| Merkmal | Standard-DRAM (DDR5) | HBM3 | HBM3e |
|---|---|---|---|
| Bandbreite | 38-51 GB/s pro Modul | 819 GB/s pro Stack | 1.200 GB/s pro Stack |
| Struktur | Einzelner Die | 8-12 gestapelte Dies | 8-12 gestapelte Dies |
| Verpackung | Standard-PCB-Montage | 2.5D/3D mit Interposer | 2.5D/3D mit Interposer |
| Die-Fläche pro GB | ~1x (Referenz) | ~2,5x | ~2,5x |
| Fertigungsausbeute | 85-95 % | 60-75 % | 55-70 % |
| Preis pro GB | ~3 USD | ~15-20 USD | ~20-30 USD |
Der zentrale Engpass: HBM erfordert das Stapeln von 8-12 einzelnen DRAM-Dies übereinander mittels Through-Silicon Vias (TSVs), gefolgt vom Bonden des Stacks auf einen Interposer neben dem GPU-Die. Jeder Stapelschritt verursacht Ausbeuteverluste. Ein einziger defekter Die in einem 12-Die-Stack macht den gesamten Stack wertlos.
Die Angebots-Nachfrage-Lücke
Die HBM-Nachfrage wächst um ungefähr 80-100 % pro Jahr, angetrieben durch AI-Beschleuniger-Deployments. Das Angebot wächst um 50-60 % pro Jahr, da Hersteller Kapazität hinzufügen. Die Lücke verengt sich, wird aber bei aktuellen Investitionsraten nicht vor 2028-2029 vollständig geschlossen.
Wie AI-Nachfrage das Consumer-GPU-Angebot kannibalisiert
Die HBM-Knappheit hat direkte und sichtbare Auswirkungen auf die Consumer-GPU-Verfügbarkeit. NVIDIA hat Berichten zufolge die Produktion der RTX-50-Serie (Blackwell Consumer) in der ersten Hälfte 2026 um 30-40 % gekürzt, da dieselbe Speicherfertigungskapazität, die Consumer-GDDR7 produziert, auch die HBM-Produktionslinien speist.
Das Speicher-Allokationsproblem
Speicherhersteller stehen vor einer Nullsummen-Allokationsentscheidung: Jeder Wafer DRAM-Silizium kann entweder für Consumer-GDDR oder AI-Grade-HBM verwendet werden. HBM erzielt 5-10x höhere Preise pro Gigabyte und kommt mit Langzeitverträgen von Hyperscaler-Kunden. Die Geschäftsentscheidung ist offensichtlich — HBM priorisieren.
Die Konsequenzen für Consumer und Nicht-AI-GPU-Nutzer:
- Höhere Consumer-GPU-Preise. Weniger GDDR-Produktion bedeutet höhere Speicherkosten für Gaming-GPUs, was sich auf die Einzelhandelspreise auswirkt
- Begrenzte Verfügbarkeit. RTX-50-Serie-Karten bleiben zum UVP schwer zu kaufen, mit Straßenpreisen 20-40 % über UVP
- Längere Produktzyklen. NVIDIA hat weniger Anreiz, Consumer-GPU-Linien aufzufrischen, wenn AI-Beschleuniger höhere Margen pro Chip generieren
Für einen tieferen Blick darauf, wie GPU-Modelle bei AI-Workloads verglichen werden und warum dies für die Hardware-Auswahl wichtig ist, siehe unseren GPU-Überblick.
Die Lieferkettenreaktion: 50 Mrd. USD+ in neue Fab-Investitionen
Speicherhersteller reagieren mit der größten Kapitalinvestition in der DRAM-Geschichte. Die gesamte zugesagte Investition über die drei HBM-Lieferanten übersteigt 50 Milliarden USD.
| Hersteller | HBM-Marktanteil (2026) | Angekündigte Investition | Zeitplan neue Kapazität |
|---|---|---|---|
| SK Hynix | ~53 % | 18 Mrd. USD+ (neue Fabs in Korea, USA) | H2 2027 - H1 2028 |
| Samsung | ~35 % | 17 Mrd. USD+ (Erweiterung in Korea, Texas) | H1 2028 |
| Micron | ~12 % | 15 Mrd. USD+ (neue Idaho-Fab, Japan-Erweiterung) | H2 2027 - 2028 |
Warum es so lange dauert
Eine neue Halbleiter-Fab benötigt 18-24 Monate zum Bau und zur Ausrüstung, gefolgt von 6-12 Monaten zur Produktionsqualifizierung — das bedeutet, dass Investitionen aus dem Jahr 2026 frühestens 2028 Volumen-HBM produzieren werden.
Die HBM-Produktion erfordert konkret:
- Advanced-Packaging-Linien für Die-Stacking (separat von der Wafer-Fab)
- Through-Silicon-Via (TSV)-Equipment, das selbst knapp ist
- Test- und Qualitätsinfrastruktur (jeder HBM-Stack durchläuft umfangreiche Tests)
- Ausgebildete Techniker für Prozesse, die nicht vollständig automatisiert sind
Die Investition findet statt, aber die Vorlaufzeiten werden in Jahren gemessen, nicht in Quartalen.
Auswirkungen auf GPU-Preise: Marktplatz- und Cloud-Raten
Die HBM-Knappheit wirkt sich direkt darauf aus, was Sie für GPU-Rechenleistung zahlen — ob beim Kauf von Hardware, der Miete von Cloud-Instanzen oder der Nutzung von GPU-Marktplätzen.
Hardware-Preise
H100-Preise auf dem Sekundärmarkt haben sich stabilisiert statt zu sinken, obwohl Blackwell-GPUs verfügbar sind. In einem normalen GPU-Zyklus fällt Hardware der Vorgängergeneration um 30-50 %, wenn eine neue Generation erscheint. Die H100 hat diesem Muster getrotzt, weil:
- Die HBM-Knappheit die Blackwell-Produktion begrenzt und die H100-Nachfrage erhöht hält
- H100-Hardware mit HBM3 bewährt und sofort einsetzbar ist
- Das Gebrauchtangebot an H100 begrenzt ist, da Betreiber keinen Grund haben, Hardware zu verkaufen, die rund um die Uhr Umsatz generiert
Für aktuelle Sekundärmarktdynamiken und Preise siehe unseren GPU Kauf- und Verkaufsleitfaden.
Cloud- und Marktplatz-Raten
| GPU | Erwartete Rate (ohne Knappheit) | Tatsächliche Rate (2026) | Aufschlag |
|---|---|---|---|
| H100 80GB (Cloud) | 2,00-3,00 USD/Std. | 2,50-4,00 USD/Std. | +25-33 % |
| H100 80GB (Marktplatz) | 1,00-1,50 USD/Std. | 1,30-2,00 USD/Std. | +30 % |
| A100 80GB (Marktplatz) | 0,50-0,80 USD/Std. | 0,70-1,20 USD/Std. | +40 % |
| B200 (Cloud) | 3,50-5,00 USD/Std. | 4,50-7,00 USD/Std. | +30-40 % |
Marktplatzpreise halten einen 25-40 %-Aufschlag über dem, was basierend auf Hardware-Abschreibungskurven allein erwartet würde. Die Knappheit verlängert effektiv die Hochumsatzperiode für GPU-Betreiber. Für umfassende Preisvergleiche über Anbieter hinweg siehe unseren Cloud-GPU-Preisvergleich.
Zeitplan: Wann wird das Angebot aufholen?
Basierend auf angekündigten Fab-Investitionen und deren Bauzeitplänen:
Ende 2027: Erste signifikante neue HBM-Kapazität kommt von SK Hynix- und Micron-Erweiterungen online. Dies lindert die akute Knappheit, schließt die Lücke aber nicht vollständig.
2028: Samsung- und zusätzliche SK-Hynix-Fabs erreichen Volumenproduktion. Das HBM-Angebotswachstum beschleunigt sich, um das Nachfragewachstum zu erreichen. Die Consumer-GDDR-Verfügbarkeit verbessert sich.
2028-2029: Angebot und Nachfrage erreichen ungefähres Gleichgewicht. GPU-Preise beginnen normalen Abschreibungskurven zu folgen. Hardware der Vorgängergeneration beginnt wie erwartet zu sinken.
Joker — Speicheranforderungen der nächsten GPU-Generation: NVIDIAs Rubin-Architektur (erwartet 2027-2028) kann noch mehr HBM pro GPU erfordern (256 GB+), was die Knappheit möglicherweise verlängert, wenn das Nachfragewachstum wieder beschleunigt.
Zentrale Erkenntnis: Die Knappheit ist nicht dauerhaft, wird aber noch 2-3 Jahre anhalten. GPU-Betreiber, die Hardware vor dem Schlimmsten der Knappheit gesichert haben, profitieren für die Dauer von erhöhten Mietraten. Neueinsteiger stehen vor höheren Hardware-Beschaffungskosten, können aber von denselben Ratenaufschlägen profitieren. Für die Investitionsperspektive auf knappheitsgetriebene GPU-Renditen siehe unsere GPU als Anlageklasse-Analyse.
Was GPU-Käufer und -Mieter jetzt tun sollten
Wenn Sie GPUs kaufen
Kaufen Sie aktuelle Hardware jetzt, wenn Sie Nachfrage haben. Auf fallende Preise zu warten kann durch entgangene Mieteinnahmen mehr kosten als die Hardware-Ersparnis. Bei aktuellen Marktplatzraten amortisiert sich H100-Hardware in 18-24 Monaten — gut innerhalb des Knappheitsfensters.
Erwägen Sie gebrauchte A100s für Inferenz. A100-80GB-GPUs zu aktuellen Gebrauchtpreisen (8.000-12.000 USD) liefern exzellente Inferenz-Kosten pro Token und sind besser verfügbar als H100s. Für einen detaillierten Vergleich zwischen GPU-Generationen siehe unseren NVIDIA vs. AMD-Leitfaden.
Sichern Sie HBM-ausgestattete Hardware, wenn verfügbar. Warten Sie nicht auf “den perfekten Kaufzeitpunkt” — während einer Knappheit ist Verfügbarkeit wichtiger als Preisoptimierung.
Wenn Sie GPU-Rechenleistung mieten
Sichern Sie reservierte Raten, wenn Ihr Workload vorhersehbar ist. Während Knappheiten sind Spotpreise volatil und tendieren nach oben. Reservierte Instanzen zu festen Raten bieten Kostensicherheit.
Nutzen Sie GPU-Marktplätze für Kosteneinsparungen. Marktplatzraten sind typischerweise 40-60 % niedriger als Hyperscaler-Raten, selbst während der Knappheit. Der Aufschlag gegenüber Nicht-Knappheitspreisen ist auf Marktplätzen kleiner als bei großen Clouds.
Erwägen Sie inferenz-optimierte Hardware. L40S- und L4-GPUs sind weniger von der HBM-Knappheit betroffen (sie nutzen weniger HBM oder Standard-GDDR) und bieten wettbewerbsfähige Inferenz-Leistung. Die Diversifizierung weg von H100-only-Workloads reduziert Ihre Exposition gegenüber HBM-getriebener Preisgestaltung.
Für einen umfassenden Entscheidungsrahmen zum Kaufen, Leasen oder Mieten von GPU-Rechenleistung siehe unseren GPU-Finanzierungsleitfaden. Für die Energiebeschränkungen, die sich mit der Chip-Knappheit potenzieren, siehe unsere Rechenzentrum-Energieanalyse.
Häufig gestellte Fragen
Was ist HBM und warum ist es für GPUs wichtig?
HBM (High Bandwidth Memory) ist eine spezialisierte DRAM-Art, die 10-30x mehr Bandbreite als Standard-DDR5-Speicher bietet. AI-Beschleuniger wie die H100 und B200 benötigen diese extreme Bandbreite, um Daten schnell genug an ihre Rechenkerne zu speisen. Ohne HBM würden diese GPUs nur mit einem Bruchteil ihrer Leistungsfähigkeit arbeiten. HBM ist die am stärksten angebotseingeschränkte Komponente in der AI-Hardware-Lieferkette.
Warum gibt es 2026 immer noch eine GPU-Knappheit?
Die Knappheit hat sich von der GPU-Chip-Fertigung (die NVIDIA und TSMC skaliert haben) zum HBM-Speicher verlagert. Die HBM-Nachfrage wächst jährlich um 80-100 %, während das Angebot um 50-60 % wächst. Nur drei Hersteller (SK Hynix, Samsung, Micron) produzieren HBM, und die Erweiterung der Produktion erfordert neue Fabs, die 18-24 Monate zum Bau benötigen.
Wie beeinflusst die Knappheit die GPU-Marktplatzpreise?
GPU-Mietraten auf Marktplätzen sind 25-40 % höher, als sie ohne die Knappheit wären. H100-Spotpreise haben sich stabilisiert, anstatt mit dem Blackwell-Launch zu sinken, und A100-Raten bleiben erhöht, da AI-Unternehmen sie für Inferenz-Workloads nutzen. Die Knappheit verlängert die Hochumsatzperiode für GPU-Betreiber.
Wann werden GPU-Preise sinken?
Signifikante Preiserleichterung wird für Ende 2027 bis 2028 erwartet, wenn neue HBM-Produktionskapazität online geht. Falls GPUs der nächsten Generation (Rubin-Architektur) noch mehr Speicher pro Chip erfordern, könnte sich die Knappheit jedoch weiter verlängern. Eine Planung für stabile bis erhöhte Preise bis mindestens 2027 ist umsichtig.
Sollte ich mit dem Kauf von GPU-Hardware warten, bis die Preise fallen?
Für Betreiber mit sofortiger umsatzgenerierender Nachfrage ist Warten typischerweise teurer als jetzt zu kaufen. Die Mieteinnahmen, die während der Wartezeit erzielt werden, übersteigen oft die potenziellen Hardware-Einsparungen. Für diejenigen ohne sofortige Nachfrage könnte das Warten auf die Angebotsnormalisierung 2028 zu 20-30 % Hardware-Kosteneinsparungen führen.