Het tekort in 2026: wat er is gebeurd en waarom
Het GPU-computetekort dat eind 2022 begon, is niet voorbij. Het is geëvolueerd. In 2026 is de bottleneck niet langer de fabricage van GPU-chips — NVIDIA en TSMC hebben de productie aanzienlijk opgeschaald. De bottleneck is verschoven naar geheugen: specifiek High Bandwidth Memory (HBM), het gespecialiseerde DRAM dat elke moderne AI-accelerator vereist.
Het tekort is het gevolg van een botsing tussen twee krachten:
Explosieve AI-vraag. Hyperscalers (Microsoft, Google, Amazon, Meta), soevereine AI-programma’s en enterprise-implementaties bestellen gezamenlijk miljoenen AI-accelerators per jaar. Elke H100 vereist 80 GB HBM3 en elke Blackwell B200 vereist 192 GB HBM3e. De totale HBM-vraag is 5x gegroeid tussen 2023 en 2026.
Beperkt geheugenhuuraanbod. HBM wordt door slechts drie bedrijven geproduceerd — SK Hynix, Samsung en Micron — met gespecialiseerde processen die niet snel kunnen worden opgeschaald. HBM-productie vereist 2–3x meer siliciumoppervlak per gigabyte dan standaard DRAM, maakt gebruik van geavanceerde verpakking (die-stacking met through-silicon vias) en heeft lagere productierendementen.
Het resultaat: de vraaggroei heeft het aanbod ver overstegen, wat een tekort creëert dat geheugenfabrikanten beschrijven als het langstdurende in de geschiedenis van de industrie.
HBM: de geheugenbottleneck achter de GPU-crisis
Wat maakt HBM anders
HBM is geen gewoon geheugen. Het biedt de extreme bandbreedte die AI-accelerators nodig hebben om data naar duizenden rekenkernen te voeren. Het begrijpen van de technische verschillen verklaart waarom het aanbod niet gemakkelijk kan worden opgeschaald:
| Eigenschap | Standaard DRAM (DDR5) | HBM3 | HBM3e |
|---|---|---|---|
| Bandbreedte | 38–51 GB/s per module | 819 GB/s per stack | 1.200 GB/s per stack |
| Structuur | Enkele die | 8–12 gestapelde dies | 8–12 gestapelde dies |
| Verpakking | Standaard PCB-montage | 2.5D/3D met interposer | 2.5D/3D met interposer |
| Die-oppervlak per GB | ~1x (referentie) | ~2,5x | ~2,5x |
| Productierendement | 85–95% | 60–75% | 55–70% |
| Prijs per GB | ~$3 | ~$15–$20 | ~$20–$30 |
De belangrijkste bottleneck: HBM vereist het stapelen van 8–12 individuele DRAM-dies bovenop elkaar met behulp van through-silicon vias (TSV’s), waarna de stack wordt verbonden met een interposer naast de GPU-die. Elke stapelingsstap introduceert rendementsverlies. Een enkele defecte die in een stack van 12 dies maakt de hele stack onbruikbaar.
De kloof tussen vraag en aanbod
De HBM-vraag groeit met ruwweg 80–100% per jaar, aangedreven door AI-accelerator-implementaties. Het aanbod groeit met 50–60% per jaar naarmate fabrikanten capaciteit toevoegen. De kloof wordt kleiner maar zal bij het huidige investeringstempo niet volledig sluiten tot 2028–2029.
Hoe AI-vraag het aanbod van consumer-GPU’s kannibaliseert
Het HBM-tekort heeft een directe en zichtbare impact op de beschikbaarheid van consumer-GPU’s. NVIDIA zou de productie van de RTX 50-serie (Blackwell consumer) met 30–40% hebben teruggebracht in de eerste helft van 2026 omdat dezelfde geheugenproductiecapaciteit die consumer GDDR7 produceert ook de HBM-productielijnen voedt.
Het geheugentoewijzingsprobleem
Geheugenfabrikanten staan voor een zero-sum toewijzingsbeslissing: elke wafer DRAM-silicium kan worden gebruikt voor consumer GDDR of AI-grade HBM. HBM levert 5–10x hogere prijzen per gigabyte op en komt met langetermijncontracten van hyperscaler-klanten. De zakelijke beslissing is duidelijk — prioriteit geven aan HBM.
De gevolgen voor consumenten en niet-AI GPU-gebruikers:
- Hogere consumer-GPU-prijzen. Minder GDDR-productie betekent hogere geheugenkosten voor gaming-GPU’s, wat doorstroomt in de verkoopprijzen
- Beperkte beschikbaarheid. RTX 50-serie kaarten blijven moeilijk te kopen tegen de adviesprijzen, met straatprijzen die 20–40% boven de adviesprijs liggen
- Langere productcycli. NVIDIA heeft minder prikkel om consumer-GPU-lijnen te vernieuwen wanneer AI-accelerators hogere marges per chip genereren
Voor een diepgaandere blik op hoe GPU-modellen zich verhouden over AI-werklasten en waarom dit belangrijk is voor hardwareselectie, zie ons GPU-overzicht.
De reactie van de toeleveringsketen: $50 miljard+ aan nieuwe fab-investeringen
Geheugenfabrikanten reageren met de grootste kapitaalinvestering in de DRAM-geschiedenis. De totale toegezegde investering van de drie HBM-leveranciers overschrijdt $50 miljard.
| Fabrikant | HBM-marktaandeel (2026) | Aangekondigde investering | Tijdlijn nieuwe capaciteit |
|---|---|---|---|
| SK Hynix | ~53% | $18 miljard+ (nieuwe fabs in Korea, VS) | H2 2027 – H1 2028 |
| Samsung | ~35% | $17 miljard+ (uitbreiding in Korea, Texas) | H1 2028 |
| Micron | ~12% | $15 miljard+ (nieuwe Idaho-fab, uitbreiding Japan) | H2 2027 – 2028 |
Waarom het zo lang duurt
Een nieuwe halfgeleiderfab vereist 18–24 maanden om te bouwen en uit te rusten, gevolgd door 6–12 maanden om de productie te kwalificeren — wat betekent dat investeringen gedaan in 2026 pas op z’n vroegst in 2028 volume-HBM zullen produceren.
HBM-productie vereist specifiek:
- Geavanceerde verpakkingslijnen voor die-stacking (gescheiden van de waferfab)
- Through-silicon via (TSV)-apparatuur die zelf schaars is
- Test- en kwaliteitsinfrastructuur (elke HBM-stack ondergaat uitgebreide tests)
- Opgeleide technici voor processen die niet volledig geautomatiseerd zijn
De investering vindt plaats, maar de doorlooptijden worden gemeten in jaren, niet in kwartalen.
Impact op GPU-prijzen: marktplaats- en cloudtarieven
Het HBM-tekort beïnvloedt direct wat u betaalt voor GPU-compute — of u nu hardware koopt, cloudinstances huurt of GPU-marktplaatsen gebruikt.
Hardwareprijzen
H100-prijzen op de secundaire markt zijn gestabiliseerd in plaats van gedaald, ondanks de beschikbaarheid van Blackwell GPU’s. In een normale GPU-cyclus daalt vorige-generatie hardware met 30–50% wanneer een nieuwe generatie wordt gelanceerd. De H100 heeft dit patroon doorbroken omdat:
- Het HBM-tekort de Blackwell-productie beperkt, waardoor de H100-vraag hoog blijft
- H100-hardware met HBM3 bewezen is en direct inzetbaar
- Het aanbod van gebruikte H100’s beperkt is omdat exploitanten geen reden hebben hardware te verkopen die 24/7 inkomsten genereert
Voor de actuele dynamiek en prijzen op de secundaire markt, zie onze gids voor het kopen en verkopen van GPU’s.
Cloud- en marktplaatstarieven
| GPU | Verwacht tarief (zonder tekort) | Werkelijk tarief (2026) | Premie |
|---|---|---|---|
| H100 80GB (cloud) | $2,00–$3,00/uur | $2,50–$4,00/uur | +25–33% |
| H100 80GB (marktplaats) | $1,00–$1,50/uur | $1,30–$2,00/uur | +30% |
| A100 80GB (marktplaats) | $0,50–$0,80/uur | $0,70–$1,20/uur | +40% |
| B200 (cloud) | $3,50–$5,00/uur | $4,50–$7,00/uur | +30–40% |
Marktplaatsprijzen houden een premie van 25–40% aan ten opzichte van wat verwacht zou worden op basis van alleen hardwareafschrijvingscurves. Het tekort verlengt effectief de hoge-inkomstenperiode voor GPU-exploitanten. Voor uitgebreide prijsvergelijkingen bij verschillende aanbieders, zie onze cloud GPU-prijsvergelijking.
Tijdlijn: wanneer haalt het aanbod de vraag in?
Op basis van aangekondigde fab-investeringen en hun bouwtijdlijnen:
Eind 2027: Eerste significante nieuwe HBM-capaciteit komt online van uitbreidingen bij SK Hynix en Micron. Dit verlicht het acute tekort maar sluit de kloof niet volledig.
2028: Samsung en aanvullende SK Hynix-fabs bereiken volumeproductie. De groei van het HBM-aanbod versnelt om de vraaggroei bij te houden. De beschikbaarheid van consumer GDDR verbetert.
2028–2029: Vraag en aanbod bereiken een bij benadering evenwicht. GPU-prijzen beginnen normale afschrijvingscurves te volgen. Vorige-generatie hardware begint te dalen zoals verwacht.
Wildcard — geheugenbehoeften van de volgende GPU-generatie: NVIDIA’s Rubin-architectuur (verwacht 2027–2028) kan nog meer HBM per GPU vereisen (256 GB+), waardoor het tekort mogelijk verlengd wordt als de vraaggroei opnieuw versnelt.
Belangrijk inzicht: Het tekort is niet permanent, maar zal nog 2–3 jaar aanhouden. GPU-exploitanten die hardware hebben veiliggesteld vóór het ergste van het tekort profiteren van verhoogde huurtarieven voor de duur ervan. Nieuwe toetreders betalen hogere hardwareanschafkosten maar kunnen nog steeds profiteren van dezelfde tariefpremies. Voor het investeringsperspectief op schaarstegedreven GPU-rendementen, zie onze GPU als activaklasse-analyse.
Wat GPU-kopers en -huurders nu moeten doen
Als u GPU’s koopt
Koop hardware van de huidige generatie nu als u vraag heeft. Wachten op prijsdalingen kan meer kosten aan misgelopen huurinkomsten dan de hardwarebesparingen opleveren. Tegen de huidige marktplaatstarieven verdient H100-hardware zich terug in 18–24 maanden — ruim binnen het tekortvenster.
Overweeg gebruikte A100’s voor inferentie. A100 80GB GPU’s tegen huidige gebruikte prijzen ($8.000–$12.000) leveren uitstekende inferentiekosten per token en zijn beter verkrijgbaar dan H100’s. Voor een gedetailleerde vergelijking tussen GPU-generaties, zie onze NVIDIA vs AMD-gids.
Stel HBM-uitgeruste hardware veilig wanneer deze beschikbaar is. Wacht niet op “het perfecte moment om te kopen” — tijdens een tekort is beschikbaarheid belangrijker dan prijsoptimalisatie.
Als u GPU-compute huurt
Leg gereserveerde tarieven vast als uw werklast voorspelbaar is. Tijdens tekorten zijn spotprijzen volatiel en stijgen ze doorgaans. Gereserveerde instances tegen vaste tarieven bieden kostenzekerheid.
Gebruik GPU-marktplaatsen voor kostenbesparingen. Marktplaatstarieven zijn doorgaans 40–60% lager dan hyperscaler-tarieven, zelfs tijdens het tekort. De premie ten opzichte van niet-tekortprijzen is kleiner op marktplaatsen dan bij grote cloudaanbieders.
Overweeg inferentie-geoptimaliseerde hardware. L40S- en L4-GPU’s worden minder getroffen door het HBM-tekort (ze gebruiken minder HBM of standaard GDDR) en bieden concurrerende inferentieprestaties. Het diversifiëren weg van alleen-H100-werklasten vermindert uw blootstelling aan HBM-gestuurde prijzen.
Voor een uitgebreid besliskader over het kopen, leasen of huren van GPU-compute, zie onze GPU-financieringsgids. Voor de energiebeperkingen die het chiptekort versterken, zie onze datacenter-energieanalyse.
Veelgestelde vragen
Wat is HBM en waarom is het belangrijk voor GPU’s?
HBM (High Bandwidth Memory) is een gespecialiseerd type DRAM dat 10–30x meer bandbreedte biedt dan standaard DDR5-geheugen. AI-accelerators zoals de H100 en B200 hebben deze extreme bandbreedte nodig om snel genoeg data aan hun rekenkernen te leveren. Zonder HBM zouden deze GPU’s op een fractie van hun capaciteit werken. HBM is het meest aanbodbeperkte onderdeel in de AI-hardware-toeleveringsketen.
Waarom is er in 2026 nog steeds een GPU-tekort?
Het tekort is verschoven van GPU-chipfabricage (die NVIDIA en TSMC hebben opgeschaald) naar HBM-geheugen. De HBM-vraag groeit met 80–100% per jaar terwijl het aanbod met 50–60% groeit. Slechts drie fabrikanten (SK Hynix, Samsung, Micron) produceren HBM, en het uitbreiden van de productie vereist de bouw van nieuwe fabs die 18–24 maanden duren.
Hoe beïnvloedt het tekort de GPU-marktplaatsprijzen?
GPU-huurtarieven op marktplaatsen zijn 25–40% hoger dan ze zonder het tekort zouden zijn. H100-spotprijzen zijn gestabiliseerd in plaats van gedaald met de Blackwell-lancering, en A100-tarieven blijven verhoogd doordat AI-bedrijven ze gebruiken voor inferentiewerklasten. Het tekort verlengt de hoge-inkomstenperiode voor GPU-exploitanten.
Wanneer zullen GPU-prijzen dalen?
Significante prijsverlichting wordt verwacht in eind 2027 tot 2028 wanneer nieuwe HBM-productiecapaciteit online komt. Als de volgende generatie GPU’s (Rubin-architectuur) echter nog meer geheugen per chip vereist, kan het tekort verder worden verlengd. Plannen voor stabiele tot verhoogde prijzen tot ten minste 2027 is verstandig.
Moet ik wachten met het kopen van GPU-hardware tot de prijzen dalen?
Voor exploitanten met directe inkomstengenererende vraag is wachten doorgaans duurder dan nu kopen. De huurinkomsten die tijdens de wachtperiode worden verdiend, overtreffen vaak de potentiële hardwarebesparingen. Voor wie geen directe vraag heeft, kan wachten op de aanbodsformalisering van 2028 20–30% hardwarekostenbesparingen opleveren.