GPUnex
Market & Trends 10 Min. Lesezeit ·

GPU-Knappheit 2026: Die HBM-Speicherkrise erklärt

NVIDIA hat die RTX-50-Serie-Produktion um 30-40 % gekürzt, da HBM-Nachfrage den Consumer-GPU-Speicher kannibalisiert. Analyse der Knappheit, Lieferkettenreaktion, Preisauswirkung und Erholungszeitplan.

G

GPUnex Research Team

GPU- & KI-Infrastruktur-Experten

Share

Wichtigste Erkenntnisse

  • NVIDIA hat die GeForce-RTX-50-Serie-Produktion im H1 2026 um 30-40 % gekürzt -- HBM-Nachfrage von AI-Hyperscalern kannibalisiert die Consumer-GPU-Speicherversorgung
  • HBM-Kosten (High Bandwidth Memory) stiegen allein im Q4 2025 um 30 %, wobei Lieferanten die Nachfrage von NVIDIA, AMD und souveränen AI-Programmen nicht decken können
  • Die GPU-Compute-Knappheit wird als die längste in der Geschichte der Branche beschrieben, wobei Lieferanten 3-5 Jahre benötigen, um vollständig aufzuholen
  • SK Hynix, Samsung und Micron investieren zusammen über 50 Milliarden USD in HBM-Produktionskapazität -- aber neue Fabs brauchen 18-24 Monate zur Inbetriebnahme
  • GPU-Marktplatzpreise spiegeln die Knappheit wider: H100-Spotpreise auf Marktplätzen haben sich stabilisiert, anstatt zu sinken, obwohl neuere Blackwell-GPUs verfügbar sind

Die Knappheit 2026: Was passiert ist und warum

Die GPU-Compute-Knappheit, die Ende 2022 begann, ist nicht beendet. Sie hat sich weiterentwickelt. Im Jahr 2026 ist der Engpass nicht mehr die GPU-Chip-Fertigung — NVIDIA und TSMC haben die Produktion deutlich gesteigert. Der Engpass hat sich stromaufwärts zum Speicher verlagert: konkret zu High Bandwidth Memory (HBM), dem spezialisierten DRAM, den jeder moderne AI-Beschleuniger benötigt.

Die Knappheit resultiert aus der Kollision zweier Kräfte:

Explodierende AI-Nachfrage. Hyperscaler (Microsoft, Google, Amazon, Meta), souveräne AI-Programme und Enterprise-Deployments bestellen zusammen Millionen von AI-Beschleunigern pro Jahr. Jede H100 benötigt 80 GB HBM3, und jede Blackwell B200 benötigt 192 GB HBM3e. Die gesamte HBM-Nachfrage ist zwischen 2023 und 2026 um das 5-Fache gewachsen.

Begrenzte Speicherversorgung. HBM wird von nur drei Unternehmen hergestellt — SK Hynix, Samsung und Micron — unter Verwendung spezialisierter Prozesse, die nicht schnell hochgefahren werden können. Die HBM-Produktion erfordert 2-3x mehr Siliziumfläche pro Gigabyte als Standard-DRAM, nutzt Advanced Packaging (Die-Stacking mit Through-Silicon Vias) und hat niedrigere Fertigungsausbeuten.

Das Ergebnis: Das Nachfragewachstum hat die Angebotsausweitung weit übertroffen und eine Knappheit geschaffen, die Speicherhersteller als die längste in der Geschichte der Branche beschreiben.

HBM: Der Speicherengpass hinter der GPU-Krise

Was HBM anders macht

HBM ist kein gewöhnlicher Speicher. Er liefert die extreme Bandbreite, die AI-Beschleuniger benötigen, um Daten an Tausende von Rechenkernen zu speisen. Das Verständnis der technischen Unterschiede erklärt, warum das Angebot nicht einfach skaliert werden kann:

MerkmalStandard-DRAM (DDR5)HBM3HBM3e
Bandbreite38-51 GB/s pro Modul819 GB/s pro Stack1.200 GB/s pro Stack
StrukturEinzelner Die8-12 gestapelte Dies8-12 gestapelte Dies
VerpackungStandard-PCB-Montage2.5D/3D mit Interposer2.5D/3D mit Interposer
Die-Fläche pro GB~1x (Referenz)~2,5x~2,5x
Fertigungsausbeute85-95 %60-75 %55-70 %
Preis pro GB~3 USD~15-20 USD~20-30 USD

Der zentrale Engpass: HBM erfordert das Stapeln von 8-12 einzelnen DRAM-Dies übereinander mittels Through-Silicon Vias (TSVs), gefolgt vom Bonden des Stacks auf einen Interposer neben dem GPU-Die. Jeder Stapelschritt verursacht Ausbeuteverluste. Ein einziger defekter Die in einem 12-Die-Stack macht den gesamten Stack wertlos.

Die Angebots-Nachfrage-Lücke

HBM-Angebot versus Nachfragelücke von 2023 bis 2029 mit projizierter Konvergenz HBM Supply vs. Demand (Exabytes shipped per year) 120 EB 90 EB 60 EB 30 EB 0 2023 2024 2025 2026 2027 2028-29 Supply Gap Projected convergence Demand Supply

Die HBM-Nachfrage wächst um ungefähr 80-100 % pro Jahr, angetrieben durch AI-Beschleuniger-Deployments. Das Angebot wächst um 50-60 % pro Jahr, da Hersteller Kapazität hinzufügen. Die Lücke verengt sich, wird aber bei aktuellen Investitionsraten nicht vor 2028-2029 vollständig geschlossen.

Wie AI-Nachfrage das Consumer-GPU-Angebot kannibalisiert

Die HBM-Knappheit hat direkte und sichtbare Auswirkungen auf die Consumer-GPU-Verfügbarkeit. NVIDIA hat Berichten zufolge die Produktion der RTX-50-Serie (Blackwell Consumer) in der ersten Hälfte 2026 um 30-40 % gekürzt, da dieselbe Speicherfertigungskapazität, die Consumer-GDDR7 produziert, auch die HBM-Produktionslinien speist.

Das Speicher-Allokationsproblem

Speicherhersteller stehen vor einer Nullsummen-Allokationsentscheidung: Jeder Wafer DRAM-Silizium kann entweder für Consumer-GDDR oder AI-Grade-HBM verwendet werden. HBM erzielt 5-10x höhere Preise pro Gigabyte und kommt mit Langzeitverträgen von Hyperscaler-Kunden. Die Geschäftsentscheidung ist offensichtlich — HBM priorisieren.

Verschiebung der Speicherproduktionsallokation von Consumer-GDDR zu AI-HBM zwischen 2023 und 2026 DRAM Production Allocation: Consumer vs. AI Memory 2023 Consumer GDDR -- 73 % HBM 17 % 10 % 2026 Consumer GDDR -- 46 % HBM -- 42 % 12 % HBM-Anteil: 17 % --> 42 % "Other" includes server DDR5 and specialty memory. Based on industry estimates of total DRAM bit production allocation.

Die Konsequenzen für Consumer und Nicht-AI-GPU-Nutzer:

  • Höhere Consumer-GPU-Preise. Weniger GDDR-Produktion bedeutet höhere Speicherkosten für Gaming-GPUs, was sich auf die Einzelhandelspreise auswirkt
  • Begrenzte Verfügbarkeit. RTX-50-Serie-Karten bleiben zum UVP schwer zu kaufen, mit Straßenpreisen 20-40 % über UVP
  • Längere Produktzyklen. NVIDIA hat weniger Anreiz, Consumer-GPU-Linien aufzufrischen, wenn AI-Beschleuniger höhere Margen pro Chip generieren

Für einen tieferen Blick darauf, wie GPU-Modelle bei AI-Workloads verglichen werden und warum dies für die Hardware-Auswahl wichtig ist, siehe unseren GPU-Überblick.

Die Lieferkettenreaktion: 50 Mrd. USD+ in neue Fab-Investitionen

Speicherhersteller reagieren mit der größten Kapitalinvestition in der DRAM-Geschichte. Die gesamte zugesagte Investition über die drei HBM-Lieferanten übersteigt 50 Milliarden USD.

HerstellerHBM-Marktanteil (2026)Angekündigte InvestitionZeitplan neue Kapazität
SK Hynix~53 %18 Mrd. USD+ (neue Fabs in Korea, USA)H2 2027 - H1 2028
Samsung~35 %17 Mrd. USD+ (Erweiterung in Korea, Texas)H1 2028
Micron~12 %15 Mrd. USD+ (neue Idaho-Fab, Japan-Erweiterung)H2 2027 - 2028

Warum es so lange dauert

Eine neue Halbleiter-Fab benötigt 18-24 Monate zum Bau und zur Ausrüstung, gefolgt von 6-12 Monaten zur Produktionsqualifizierung — das bedeutet, dass Investitionen aus dem Jahr 2026 frühestens 2028 Volumen-HBM produzieren werden.

Die HBM-Produktion erfordert konkret:

  • Advanced-Packaging-Linien für Die-Stacking (separat von der Wafer-Fab)
  • Through-Silicon-Via (TSV)-Equipment, das selbst knapp ist
  • Test- und Qualitätsinfrastruktur (jeder HBM-Stack durchläuft umfangreiche Tests)
  • Ausgebildete Techniker für Prozesse, die nicht vollständig automatisiert sind

Die Investition findet statt, aber die Vorlaufzeiten werden in Jahren gemessen, nicht in Quartalen.

Auswirkungen auf GPU-Preise: Marktplatz- und Cloud-Raten

Die HBM-Knappheit wirkt sich direkt darauf aus, was Sie für GPU-Rechenleistung zahlen — ob beim Kauf von Hardware, der Miete von Cloud-Instanzen oder der Nutzung von GPU-Marktplätzen.

Hardware-Preise

H100-Preise auf dem Sekundärmarkt haben sich stabilisiert statt zu sinken, obwohl Blackwell-GPUs verfügbar sind. In einem normalen GPU-Zyklus fällt Hardware der Vorgängergeneration um 30-50 %, wenn eine neue Generation erscheint. Die H100 hat diesem Muster getrotzt, weil:

  • Die HBM-Knappheit die Blackwell-Produktion begrenzt und die H100-Nachfrage erhöht hält
  • H100-Hardware mit HBM3 bewährt und sofort einsetzbar ist
  • Das Gebrauchtangebot an H100 begrenzt ist, da Betreiber keinen Grund haben, Hardware zu verkaufen, die rund um die Uhr Umsatz generiert

Für aktuelle Sekundärmarktdynamiken und Preise siehe unseren GPU Kauf- und Verkaufsleitfaden.

Cloud- und Marktplatz-Raten

GPUErwartete Rate (ohne Knappheit)Tatsächliche Rate (2026)Aufschlag
H100 80GB (Cloud)2,00-3,00 USD/Std.2,50-4,00 USD/Std.+25-33 %
H100 80GB (Marktplatz)1,00-1,50 USD/Std.1,30-2,00 USD/Std.+30 %
A100 80GB (Marktplatz)0,50-0,80 USD/Std.0,70-1,20 USD/Std.+40 %
B200 (Cloud)3,50-5,00 USD/Std.4,50-7,00 USD/Std.+30-40 %

Marktplatzpreise halten einen 25-40 %-Aufschlag über dem, was basierend auf Hardware-Abschreibungskurven allein erwartet würde. Die Knappheit verlängert effektiv die Hochumsatzperiode für GPU-Betreiber. Für umfassende Preisvergleiche über Anbieter hinweg siehe unseren Cloud-GPU-Preisvergleich.

Zeitplan: Wann wird das Angebot aufholen?

Basierend auf angekündigten Fab-Investitionen und deren Bauzeitplänen:

Ende 2027: Erste signifikante neue HBM-Kapazität kommt von SK Hynix- und Micron-Erweiterungen online. Dies lindert die akute Knappheit, schließt die Lücke aber nicht vollständig.

2028: Samsung- und zusätzliche SK-Hynix-Fabs erreichen Volumenproduktion. Das HBM-Angebotswachstum beschleunigt sich, um das Nachfragewachstum zu erreichen. Die Consumer-GDDR-Verfügbarkeit verbessert sich.

2028-2029: Angebot und Nachfrage erreichen ungefähres Gleichgewicht. GPU-Preise beginnen normalen Abschreibungskurven zu folgen. Hardware der Vorgängergeneration beginnt wie erwartet zu sinken.

Joker — Speicheranforderungen der nächsten GPU-Generation: NVIDIAs Rubin-Architektur (erwartet 2027-2028) kann noch mehr HBM pro GPU erfordern (256 GB+), was die Knappheit möglicherweise verlängert, wenn das Nachfragewachstum wieder beschleunigt.

Zentrale Erkenntnis: Die Knappheit ist nicht dauerhaft, wird aber noch 2-3 Jahre anhalten. GPU-Betreiber, die Hardware vor dem Schlimmsten der Knappheit gesichert haben, profitieren für die Dauer von erhöhten Mietraten. Neueinsteiger stehen vor höheren Hardware-Beschaffungskosten, können aber von denselben Ratenaufschlägen profitieren. Für die Investitionsperspektive auf knappheitsgetriebene GPU-Renditen siehe unsere GPU als Anlageklasse-Analyse.

Was GPU-Käufer und -Mieter jetzt tun sollten

Wenn Sie GPUs kaufen

Kaufen Sie aktuelle Hardware jetzt, wenn Sie Nachfrage haben. Auf fallende Preise zu warten kann durch entgangene Mieteinnahmen mehr kosten als die Hardware-Ersparnis. Bei aktuellen Marktplatzraten amortisiert sich H100-Hardware in 18-24 Monaten — gut innerhalb des Knappheitsfensters.

Erwägen Sie gebrauchte A100s für Inferenz. A100-80GB-GPUs zu aktuellen Gebrauchtpreisen (8.000-12.000 USD) liefern exzellente Inferenz-Kosten pro Token und sind besser verfügbar als H100s. Für einen detaillierten Vergleich zwischen GPU-Generationen siehe unseren NVIDIA vs. AMD-Leitfaden.

Sichern Sie HBM-ausgestattete Hardware, wenn verfügbar. Warten Sie nicht auf “den perfekten Kaufzeitpunkt” — während einer Knappheit ist Verfügbarkeit wichtiger als Preisoptimierung.

Wenn Sie GPU-Rechenleistung mieten

Sichern Sie reservierte Raten, wenn Ihr Workload vorhersehbar ist. Während Knappheiten sind Spotpreise volatil und tendieren nach oben. Reservierte Instanzen zu festen Raten bieten Kostensicherheit.

Nutzen Sie GPU-Marktplätze für Kosteneinsparungen. Marktplatzraten sind typischerweise 40-60 % niedriger als Hyperscaler-Raten, selbst während der Knappheit. Der Aufschlag gegenüber Nicht-Knappheitspreisen ist auf Marktplätzen kleiner als bei großen Clouds.

Erwägen Sie inferenz-optimierte Hardware. L40S- und L4-GPUs sind weniger von der HBM-Knappheit betroffen (sie nutzen weniger HBM oder Standard-GDDR) und bieten wettbewerbsfähige Inferenz-Leistung. Die Diversifizierung weg von H100-only-Workloads reduziert Ihre Exposition gegenüber HBM-getriebener Preisgestaltung.

Für einen umfassenden Entscheidungsrahmen zum Kaufen, Leasen oder Mieten von GPU-Rechenleistung siehe unseren GPU-Finanzierungsleitfaden. Für die Energiebeschränkungen, die sich mit der Chip-Knappheit potenzieren, siehe unsere Rechenzentrum-Energieanalyse.

Häufig gestellte Fragen

Was ist HBM und warum ist es für GPUs wichtig?

HBM (High Bandwidth Memory) ist eine spezialisierte DRAM-Art, die 10-30x mehr Bandbreite als Standard-DDR5-Speicher bietet. AI-Beschleuniger wie die H100 und B200 benötigen diese extreme Bandbreite, um Daten schnell genug an ihre Rechenkerne zu speisen. Ohne HBM würden diese GPUs nur mit einem Bruchteil ihrer Leistungsfähigkeit arbeiten. HBM ist die am stärksten angebotseingeschränkte Komponente in der AI-Hardware-Lieferkette.

Warum gibt es 2026 immer noch eine GPU-Knappheit?

Die Knappheit hat sich von der GPU-Chip-Fertigung (die NVIDIA und TSMC skaliert haben) zum HBM-Speicher verlagert. Die HBM-Nachfrage wächst jährlich um 80-100 %, während das Angebot um 50-60 % wächst. Nur drei Hersteller (SK Hynix, Samsung, Micron) produzieren HBM, und die Erweiterung der Produktion erfordert neue Fabs, die 18-24 Monate zum Bau benötigen.

Wie beeinflusst die Knappheit die GPU-Marktplatzpreise?

GPU-Mietraten auf Marktplätzen sind 25-40 % höher, als sie ohne die Knappheit wären. H100-Spotpreise haben sich stabilisiert, anstatt mit dem Blackwell-Launch zu sinken, und A100-Raten bleiben erhöht, da AI-Unternehmen sie für Inferenz-Workloads nutzen. Die Knappheit verlängert die Hochumsatzperiode für GPU-Betreiber.

Wann werden GPU-Preise sinken?

Signifikante Preiserleichterung wird für Ende 2027 bis 2028 erwartet, wenn neue HBM-Produktionskapazität online geht. Falls GPUs der nächsten Generation (Rubin-Architektur) noch mehr Speicher pro Chip erfordern, könnte sich die Knappheit jedoch weiter verlängern. Eine Planung für stabile bis erhöhte Preise bis mindestens 2027 ist umsichtig.

Sollte ich mit dem Kauf von GPU-Hardware warten, bis die Preise fallen?

Für Betreiber mit sofortiger umsatzgenerierender Nachfrage ist Warten typischerweise teurer als jetzt zu kaufen. Die Mieteinnahmen, die während der Wartezeit erzielt werden, übersteigen oft die potenziellen Hardware-Einsparungen. Für diejenigen ohne sofortige Nachfrage könnte das Warten auf die Angebotsnormalisierung 2028 zu 20-30 % Hardware-Kosteneinsparungen führen.

Share

Ready to Get Started?

Earn daily revenue from GPU compute demand. Packages start at $59.