Het Snelle Antwoord: Welke GPU Moet U Kiezen?
Er is geen enkele “beste GPU voor AI.” De juiste keuze hangt af van drie factoren: wat u doet (training, fine-tuning of inferentie), hoe groot uw model is (1B parameters of 70B+), en hoeveel u wilt uitgeven (per uur en totaal).
Als u een antwoord in één zin wilt: voor grootschalige training, de H100 of B200. Voor kosteneffectieve fine-tuning, de RTX 4090 of A100. Voor productie-inferentie, de L40S of L4. Maar het echte verhaal zit in de cijfers — specifiek in de metriek die de meeste GPU-gidsen negeren: kosten per TFLOP.
Deze gids richt zich op die metriek. In plaats van ruwe specificatietabellen te herhalen die beschikbaar zijn in onze complete GPU-gids, analyseren we welke GPU u de meeste AI-prestaties per dollar biedt voor uw specifieke workload.
Kosten-per-TFLOP: De Metriek Die Er Echt Toe Doet
Ruwe TFLOPS (biljoenen drijvende-komma-bewerkingen per seconde) vertelt u hoe snel een GPU rekent. Maar snel betekent niets zonder context. Een H200 levert ~1.000 FP16 TFLOPS, maar kost $3,80/uur. Een RTX 4090 levert ~330 FP16 TFLOPS voor $0,60/uur. Welke is eigenlijk de betere deal?
Kosten-per-TFLOP beantwoordt dat: deel de huurprijs per uur door de FP16 TFLOPS-rating. Lager is beter.
De resultaten zijn contra-intuïtief. De RTX 4090 — een consumentengamingkaart — levert de beste kosten-per-TFLOP van de hele reeks. De B200 — NVIDIA’s nieuwste datacenter-flagship — komt op de tweede plaats. De populaire H100 zit in het midden, en de L40S is het minst efficiënt per TFLOP.
Maar kosten-per-TFLOP is niet het hele verhaal. De RTX 4090 heeft slechts 24 GB GDDR6X VRAM, wat haar beperkt tot modellen die in dat geheugen passen. De B200 heeft 192 GB HBM3e, die 8x grotere modellen kan bevatten. Ruwe efficiëntie moet worden afgewogen tegen capaciteit.
| GPU | VRAM | FP16 TFLOPS | Cloud $/uur | Kosten/TFLOP/uur | Aankoopprijs | TDP |
|---|---|---|---|---|---|---|
| B200 | 192 GB HBM3e | ~2.500 | ~$4,70 | $0,0019 | $45–50K | 1.000W |
| H200 | 141 GB HBM3e | ~1.000 | ~$3,80 | $0,0038 | $30–40K | 700W |
| H100 | 80 GB HBM3 | ~1.000 | ~$3,15 | $0,0032 | ~$25K | 700W |
| A100 80GB | 80 GB HBM2e | ~312 | ~$0,72 | $0,0023 | ~$15K (gebruikt) | 300W |
| L40S | 48 GB GDDR6X | ~366 | ~$1,50 | $0,0041 | ~$8K | 350W |
| RTX 4090 | 24 GB GDDR6X | ~330 | ~$0,60 | $0,0018 | ~$1.600 | 450W |
Belangrijk inzicht: De duurste GPU per uur is niet altijd de duurste per eenheid werk. Kosten-per-TFLOP onthult dat de RTX 4090 en B200 de efficiëntieleiders zijn — aan tegenovergestelde uiteinden van het capaciteitsspectrum.
Workload-Aanbevelingen: GPU Afstemmen op Taak
De juiste GPU is niet de snelste of goedkoopste — het is degene die bij uw workload past. Hier is een praktisch beslissingskader.
Fine-Tuning van Kleine tot Middelgrote Modellen (7B–13B Parameters)
Beste keuze: RTX 4090 ($0,60/uur) of A100 40GB
Fine-tuning van een 7B-parametermodel met LoRA of QLoRA vereist ongeveer 14–20 GB VRAM — ruim binnen de 24 GB van de RTX 4090. Voor $0,60/uur op GPU-marketplaces kost een 10 uur durende fine-tuningsessie slechts $6. Dezelfde taak op een H100 voor $3,15/uur kost $31,50 — meer dan 5x meer voor een workload die de extra VRAM of bandbreedte van de H100 niet nodig heeft.
Voor volledige fine-tuning (zonder LoRA) van 13B-modellen biedt de A100 40GB voor ~$0,72/uur voldoende VRAM tegen een fractie van de H100-prijs.
Pre-Training van Grote Modellen (70B+ Parameters)
Beste keuze: H100 of B200 in multi-GPU clusters
Pre-training van een 70B+ parametermodel vereist 140+ GB VRAM alleen al voor het model, plus activaties, gradiënten en optimizer-states. Geen enkele GPU behalve de B200 (192 GB) kan dit in het geheugen houden. In de praktijk draaien deze workloads op multi-GPU clusters met modelparallelisme en dataparallelisme over 8–128+ GPU’s.
De NVLink 4.0 van de H100 (900 GB/s bidirectioneel) maakt efficiënte multi-GPU-communicatie mogelijk — cruciaal voor gedistribueerde training waar GPU’s elke forward/backward pass gradiënten moeten delen. De B200 gaat nog verder met hogere bandbreedte en meer geheugen, maar de beschikbaarheid blijft beperkt tot 2027.
Op schaal zijn de totale kosten enorm. De training van GPT-4 gebruikte naar verluidt 10.000+ A100 GPU’s die maandenlang draaiden. Zelfs tegen marketplace-prijzen kost een 1.000-GPU H100-cluster dat 30 dagen draait ongeveer $2,3 miljoen.
Productie-Inferentie (Batchverwerking)
Beste keuze: L40S ($1,50/uur) voor kostenefficiëntie
Batchinferentie — veel verzoeken tegelijkertijd verwerken — profiteert van de 48 GB GDDR6X VRAM en sterke FP16-prestaties van de L40S. Hoewel de kosten-per-TFLOP hoger zijn dan die van de RTX 4090, kan het dubbele VRAM-capaciteit grotere modellen en grotere batchgroottes bedienen, waardoor de doorvoer per dollar verbetert.
Voor inferentieworkloads waar het model in 24 GB past (de meeste 7B-modellen na kwantisatie), blijft de RTX 4090 de meest kosteneffectieve optie.
Productie-Inferentie (Lage Latentie)
Beste keuze: H200 voor snelheid, L4 voor edge
Wanneer single-request latentie meer uitmaakt dan doorvoer (chatbots, realtime API’s), levert de geheugenbandbreedte van 4.800 GB/s van de H200 de snelste tokengeneratie. De L4 ($0,30–$1,00/uur) dient als budgetoptie voor lichtgewicht inferentie aan de edge — 24 GB VRAM tegen een fractie van de kosten.
Stroomverbruik en Operationele Kosten
GPU-selectie gaat niet alleen over rekenkracht en cloudprijzen. Als u hardware bezit (of overweegt), lopen elektriciteitskosten aanzienlijk op over tijd.
| GPU | TDP (Watt) | Jaarlijkse Elektriciteitskosten* | Effectieve $/uur (eigendom over 3 jaar) |
|---|---|---|---|
| B200 | 1.000W | ~$526/jaar | ~$1,80 |
| H100 / H200 | 700W | ~$368/jaar | ~$1,05 |
| RTX 4090 | 450W | ~$237/jaar | ~$0,25 |
| L40S | 350W | ~$184/jaar | ~$0,40 |
| A100 | 300W | ~$158/jaar | ~$0,55 |
Uitgaand van 60% gemiddeld gebruik en $0,10/kWh elektriciteitskosten.
Het TDP van 1.000W van de B200 maakt het de meest stroomhongerige GPU in de reeks — met meer dan $500/jaar alleen aan elektriciteit bij matig gebruik. Voor hardware-eigenaren in regio’s met hoge elektriciteitskosten (boven $0,25/kWh, gebruikelijk in veel van Europa), heeft dit een aanzienlijke impact op de economie van GPU-eigendom versus cloudhuur.
Break-Even Analyse: Kopen vs. Huren
De beslissing om GPU’s te kopen of te huren komt neer op gebruik en tijdshorizon. Hier is de berekening voor de H100 — het meest voorkomende beslispunt:
- H100 aankoopprijs: ~$25.000
- Marketplace-huurprijs: ~$3,15/uur
- Break-even uren: 25.000 ÷ 3,15 = ~7.937 uur
- Bij 24/7 gebruik: ~11 maanden om break-even te bereiken
- Bij 60% gebruik: ~18 maanden om break-even te bereiken
Tel elektriciteit ($0,07/uur), koelingsoverhead ($0,02/uur) en onderhoud erbij, en de effectieve eigendomskosten over 3 jaar zijn ongeveer $1,05/uur — concurrerend met marketplace-prijzen maar alleen bij aanhoudend hoog gebruik.
De kritische variabele is gebruik. Als uw GPU’s 50% van de tijd stilstaan, betaalt u het dubbele van het effectieve tarief. Cloudhuur elimineert stilstandkosten volledig — u betaalt alleen wanneer de rekenkracht draait.
Voor een compleet huur-vs-koop framework inclusief koeling, faciliteiten, personeel en afschrijving, zie onze gedetailleerde kostenvergelijking.
Vooruitzicht 2026: Blackwell, Rubin en Wat Er Komt
Het GPU-landschap verschuift snel. Dit is wat er toe doet voor het plannen van uw AI-infrastructuur:
NVIDIA B200 (Blackwell-architectuur) — Wordt al in beperkte hoeveelheden geleverd, de B200 levert ongeveer 4x de trainingsprestaties van de H100 met 192 GB HBM3e en een TDP van 1.000W. Het is de beste keuze voor nieuwe grootschalige trainingsclusters maar blijft beperkt beschikbaar tot 2027. Cloudbeschikbaarheid breidt uit bij hyperscalers en gespecialiseerde aanbieders.
NVIDIA Rubin-architectuur — Aangekondigd voor eind 2026, Rubin bevat 336 miljard transistoren en richt zich op 50 PFLOPS FP4-inferentie. Als volgens schema geleverd, vertegenwoordigt het een sprong van ongeveer 5x ten opzichte van Blackwell voor inferentiedoorvoer. Dit zal de kosten-per-TFLOP vergelijking dramatisch verschuiven — maar aanschaftermijnen betekenen dat de meeste teams pas in 2027 toegang hebben tot Rubin-hardware.
AMD MI350X en MI355X — AMD’s antwoord op Blackwell. De MI355X heeft 30% snellere inferentie gedemonstreerd dan de B200 op Llama 3.1 405B, met concurrerende prijzen. AMD’s groeiende ROCm-ecosysteem vermindert CUDA-afhankelijkheid voor inferentieworkloads. Voor een gedetailleerde vergelijking, zie onze NVIDIA vs. AMD analyse.
De praktische implicatie: Koop geen hardware vandaag met de verwachting dat het 3+ jaar top-tier blijft. GPU-generaties wisselen elke 18–24 maanden, en elke generatie levert 2–4x de prestaties van de vorige. Voor de meeste teams geeft huren u toegang tot de nieuwste hardware zonder afschrijvingsrisico.
Hoe Te Kiezen: De Beslissingschecklist
Voordat u een GPU selecteert, beantwoord deze vijf vragen:
-
Wat is uw workload? Training, fine-tuning of inferentie? Elk heeft verschillende reken-, geheugen- en bandbreedtevereisten.
-
Hoe groot is uw model? Modellen onder 13B parameters kunnen draaien op 24 GB GPU’s. Modellen boven 70B vereisen multi-GPU setups met 80+ GB per GPU.
-
Wat is uw budget per uur? Als onder $1/uur, zijn uw opties RTX 4090, A100 op spot, of L4. Als $3+/uur, kunt u H100 of B200 gebruiken.
-
Hoeveel uur per maand gaat u gebruiken? Minder dan 100 uur → altijd huren. 100–500 uur → huren via marketplaces. Meer dan 500 uur bij hoog gebruik → eigendom overwegen.
-
Hoe lang heeft u deze hardware nodig? Minder dan 18 maanden → huren (vermijdt afschrijving). 18+ maanden bij hoog gebruik → kopen kan break-even bereiken. Voor een diepere vergelijking tussen GPU-architecturen, inclusief hoe CPU’s en GPU’s elkaar aanvullen, zie onze GPU vs. CPU gids.
Belangrijk inzicht: De “beste” GPU is de goedkoopste die uw specifieke workload kan draaien. Een RTX 4090 die een 7B-model fine-tunet is een betere investering dan een H100 die hetzelfde doet — u krijgt hetzelfde resultaat voor 1/5e van de kosten.
Veelgestelde Vragen
Wat is de beste GPU voor het trainen van grote taalmodellen?
Voor modellen boven 70B parameters blijft de NVIDIA H100 de standaard — met 80 GB HBM3, NVLink 4.0 voor multi-GPU schaling en het meest volwassen software-ecosysteem. De B200 is de volgende stap met 192 GB HBM3e en ongeveer 4x de trainingsprestaties, maar de beschikbaarheid is beperkt. Voor kleinere modellen (7B–13B) bieden de RTX 4090 of A100 uitstekende prestaties tegen een fractie van de kosten. Voor een gedetailleerde vergelijking van NVIDIA’s Ampere-generatie opties, zie onze A100 vs A6000 vs A2000 analyse.
Is de RTX 4090 goed voor AI?
Ja — het is een van de meest kosteneffectieve GPU’s voor AI fine-tuning en inferentie van kleine tot middelgrote modellen. De 24 GB VRAM kan modellen tot ~13B parameters aan (met kwantisatie), en de kosten-per-TFLOP zijn de beste in de industrie. De beperking is VRAM: voor modellen die 24 GB overschrijden, hebt u een datacenter-GPU met meer geheugen nodig. Het mist ook NVLink, waardoor multi-GPU schaling minder efficiënt is dan datacenterkaarten.
Moet ik een GPU kopen of huren voor AI?
Huren als uw gebruik onder 60% ligt of uw tijdshorizon korter is dan 18 maanden. De GPU-markt beweegt snel — een nieuwe architectuur elke 2 jaar betekent dat gekochte hardware snel afschrijft. Huren via GPU-marketplaces geeft u toegang tot de nieuwste hardware voor $0,60–$3,15/uur zonder kapitaalinvestering. Alleen kopen als u aanhoudende, voorspelbare workloads hebt die 500+ uur/maand draaien gedurende 2+ jaar.
Wat is kosten-per-TFLOP en waarom is het belangrijk?
Kosten-per-TFLOP deelt de huurkosten per uur van een GPU door de drijvende-komma prestaties in TFLOPS. Het normaliseert prestaties over GPU-modellen, waardoor wordt onthuld welke kaart u de meeste AI-rekenkracht per dollar geeft. Een GPU met een laag uurtarief maar lage prestaties kan in werkelijkheid meer kosten per eenheid werk dan een duurdere GPU met hogere prestaties. Het is de dichtstbijzijnde enkele metriek voor “waar voor uw geld” in GPU-computing.
Hoeveel VRAM heb ik nodig voor AI?
Een vuistregel: een model met N miljard parameters vereist ongeveer 2×N GB VRAM voor inferentie in FP16, en 4×N GB voor training (vanwege gradiënten en optimizer-states). Een 7B-model heeft ~14 GB nodig voor inferentie, ~28 GB voor volledige fine-tuning. Kwantisatie (INT8, INT4) kan VRAM-vereisten met 2–4x verminderen. Gebruik de RTX 4090 (24 GB) voor modellen tot ~13B gekwantiseerd, de A100/L40S (48–80 GB) voor modellen tot ~40B, en de H100/H200/B200 (80–192 GB) voor 70B+ modellen.