De grote getallen: wat frontier-modellen werkelijk kosten
Het trainen van een frontier AI-model is een van de duurste engineeringprojecten in de menselijke geschiedenis. Dit zijn de werkelijke cijfers:
| Model | Jaar | Geschatte trainingskosten | GPU-hardware | Trainingsduur |
|---|---|---|---|---|
| GPT-3 (175B) | 2020 | ~$4,6 miljoen | ~1.000 V100 GPU’s | ~34 dagen |
| PaLM (540B) | 2022 | ~$12 miljoen | 6.144 TPU v4-chips | ~50 dagen |
| GPT-4 (~1,8T MoE) | 2023 | ~$79 miljoen | 10.000+ A100 GPU’s | ~100 dagen |
| Gemini Ultra | 2024 | ~$191 miljoen | 16.384 TPU v5-chips | ~130 dagen |
| Llama 3.1 405B | 2024 | ~$60 miljoen | 16.384 H100 GPU’s | ~54 dagen |
| DeepSeek R1 | 2025 | ~$294.000 | ~2.000 H800 GPU’s | ~55 dagen |
Het DeepSeek R1-getal valt op. Terwijl frontier-labs honderden miljoenen uitgeven, behaalde DeepSeek competitieve prestaties voor minder dan $300.000 door agressieve efficiëntieoptimalisaties — wat bewijst dat kosten niet puur een functie van modelkwaliteit zijn.
Uitsplitsing van trainingskosten: compute, data en engineering
Trainingskosten zijn niet alleen GPU-huur. Dit is waar het geld werkelijk naartoe gaat:
GPU compute (65%) is de dominante kostenpost. Voor een trainingsrun van $79M gaat ongeveer $51 miljoen naar GPU-huur of afgeschreven hardwarekosten. Dit is de kostencomponent die het meest gevoelig is voor providerkeuze en hardware-efficiëntie.
Datavoorbereiding (15%) omvat webcrawling, filtering, deduplicatie, tokenisatie en menselijke labeling voor RLHF. Data van hoge kwaliteit wordt steeds duurder — synthetische data en geautomatiseerde pipelines verlagen de kosten maar elimineren ze niet.
Engineering (12%) dekt de ML-onderzoekers, infrastructuurengineers en ondersteunend personeel die de training ontwerpen, uitvoeren en debuggen. Top AI-onderzoekers verdienen $1M+ per jaar. Een frontier-trainingsrun vereist een team van 20–50+ engineers gedurende maanden.
Infrastructuur (8%) omvat opslag (petabytes aan trainingsdata), high-speed netwerken (400 GbE tussen nodes), orchestratiesoftware en monitoring. Vaak onderschat in initiële budgetten.
De kostenparadox: waarom uitgaven stijgen terwijl eenheidskosten kelderen
Dit is de contra-intuïtieve realiteit: totale trainingskosten stijgen exponentieel terwijl de kosten per rekeneenheid exponentieel dalen.
- Totale uitgaven groeien met 2,4× per jaar — labs trainen grotere modellen op meer data
- Kosten per FLOP dalen met ongeveer 10× per jaar — betere hardware, betere algoritmen
- Trainingskosten als percentage van omzet stijgen — zelfs bedrijven met een waarde van biljoenen dollars voelen de druk
Deze paradox bestaat omdat labs sneller schalen dan efficiëntiewinsten kunnen compenseren. Elke nieuwe modelgeneratie is 5–10× groter dan de vorige, terwijl efficiëntiewinsten de kosten per FLOP met 2–3× per generatie verlagen. Het nettoresultaat: meer uitgaven ondanks goedkopere compute.
Wat dit betekent voor GPU-vraag: Zelfs naarmate individuele GPU’s krachtiger en efficiënter worden, blijft het totale aantal GPU’s dat nodig is voor frontier-training groeien. Dit houdt de vraag — en het prijszettingsvermogen — voor GPU-infrastructuurproviders in stand.
Trainingskosten per modelgrootte: van 7B tot 1T+ parameters
Niet iedereen traint frontier-modellen. Dit is wat training kost op verschillende schalen:
| Modelgrootte | Typische trainingscompute | Geschatte kosten (H100 marktplaats) | Geschatte kosten (AWS) |
|---|---|---|---|
| 1B parameters | ~1.000 GPU-uren | ~$1.500–$2.500 | ~$4.000–$7.000 |
| 7B parameters | ~10.000 GPU-uren | ~$15.000–$25.000 | ~$40.000–$70.000 |
| 13B parameters | ~25.000 GPU-uren | ~$37.500–$62.500 | ~$100.000–$175.000 |
| 70B parameters | ~200.000 GPU-uren | ~$300.000–$500.000 | ~$800.000–$1,4M |
| 405B parameters | ~1.500.000 GPU-uren | ~$2,2M–$3,7M | ~$6M–$10,5M |
| 1T+ (frontier) | ~10.000.000+ GPU-uren | ~$15M–$25M | ~$40M–$70M |
Let op: dit zijn ruwe schattingen. Werkelijke kosten variëren aanzienlijk op basis van trainingsefficiëntie, datakwaliteit, mislukte hyperparametertuning en hardwarebenutting.
Het 2–3× kostenverschil tussen marktplaats- en hyperscalerprijzen is consistent over alle schalen. Voor een startup die een 7B-model traint, is dat het verschil tussen $15K en $40K — betekenisvol maar beheersbaar. Voor een frontier-lab dat een 1T+-model traint, gaat het om tientallen miljoenen dollars.
Hoe providerkeuze trainingsbudgetten beïnvloedt
Waar je GPU’s huurt is een van de meest impactvolle kostenbeslissingen in AI:
| Providertype | H100 maandelijkse kosten (24/7) | 12-maandskosten | Besparing vs. AWS |
|---|---|---|---|
| AWS (on-demand) | ~$2.800 | ~$33.600 | — |
| Gespecialiseerde cloud (Lambda) | ~$2.150 | ~$25.800 | 23% |
| Marktplaats (geverifieerde host) | ~$1.150 | ~$13.800 | 59% |
| Gereserveerd/vastgelegd | ~$1.700 | ~$20.400 | 39% |
Voor een trainingsrun van 1.000 GPU-uren is het verschil tussen AWS on-demand en een marktplaats ongeveer $2.000. Schaal dat naar een run van 100.000 GPU-uren, en het verschil is $200.000. Op frontier-schaal beïnvloedt providerkeuze budgetten met miljoenen.
Bekijk voor gedetailleerde prijsvergelijkingen bij alle grote providers onze gids voor cloud GPU-prijzen. Bekijk voor het kiezen van het juiste GPU-model onze gids voor de beste GPU voor AI.
Belangrijk inzicht: Veel teams kiezen standaard hun bestaande cloudprovider (AWS, GCP, Azure) voor training omdat het handig is. Dit gemak kan 40–60% meer kosten dan marktplaatsalternatieven. Voor trainingsruns van meer dan $10.000 verdient de 30 minuten die je besteedt aan het opzetten van een marktplaatsaccount zich honderden keren terug.
Efficiëntiedoorbraken: betere modellen trainen voor minder
Het DeepSeek R1-voorbeeld ($294.000 voor competitieve prestaties) illustreert dat brute uitgaven niet de enige weg zijn. Belangrijke efficiëntietechnieken in 2026:
Mixture of Experts (MoE): Slechts een subset van modelparameters wordt geactiveerd per invoer, waardoor compute per forward pass met 4–8× wordt verminderd. GPT-4 gebruikt naar verluidt MoE — een ~1,8T-parametermodel waarvan slechts ~280B parameters per token worden geactiveerd. Dit vermindert de FLOP-vereisten per effectieve parameter drastisch.
Quantisering-bewuste training: Trainen in lagere precisie (BF16, FP8) vanaf het begin vermindert geheugen- en computevereisten met 2–4× bij minimale kwaliteitsimpact. NVIDIA Blackwell GPU’s ondersteunen FP4-training native.
Datakwaliteit boven kwantiteit: OpenAI’s onderzoek toont aan dat training op kleinere, hogere-kwaliteit datasets modellen kan evenaren die getraind zijn op 10× meer data van lagere kwaliteit. Investering in datacuratie vermindert computevereisten.
Architectuurinnovaties: Technieken zoals Ring Attention (voor lange context), FlashAttention (voor geheugenefficiëntie) en speculative decoding (voor snellere inferentie) stapelen efficiëntiewinsten op. Elke generatie technieken vermindert de compute die nodig is voor een bepaald kwaliteitsniveau.
Distillatie: Het trainen van een kleiner “student”-model om een groter “teacher”-model na te bootsen kan 80–95% van de prestaties van het teacher-model bereiken tegen 10–100× lagere trainings- en inferentiekosten.
Projecties: waar trainingskosten naartoe gaan (2026–2028)
De bovengrens blijft stijgen. Anthropic’s Dario Amodei heeft verklaard dat frontier-modellen tegen 2028 $10 miljard kunnen kosten om te trainen. Of een enkel model daadwerkelijk zoveel zal kosten, hangt af van efficiëntiewinsten en de economie van afnemend rendement.
De ondergrens blijft dalen. Tegelijkertijd blijven de kosten om een “GPT-4-equivalent” model te trainen dalen — van $79M in 2023 naar een geschatte $5–$10M in 2026 met huidige-generatie hardware en efficiëntietechnieken. Wat twee jaar geleden frontier-duur was, wordt haalbaar voor goed gefinancierde startups.
De implicatie voor GPU-vraag: Beide trends houden GPU-vraag in stand. Frontier-labs hebben meer GPU’s nodig voor grotere modellen. Kleinere organisaties hebben GPU’s nodig om te trainen wat recent onmogelijk was. De totaal adresseerbare markt voor trainingscompute breidt zich in beide richtingen uit.
Bekijk voor hoe inferentiekosten een vergelijkbare maar nog steilere daling volgen onze analyse van inferentie-economie. Bekijk voor startupspecifieke budgetteringsadvies onze gids voor AI-startup rekenkosten.
Veelgestelde vragen
Hoeveel kost het om een model te fine-tunen?
Fine-tuning is dramatisch goedkoper dan pre-training. Fine-tuning van een 7B-model kost ongeveer $50–$500 op een GPU-marktplaats (enkele honderden GPU-uren). Fine-tuning van een 70B-model kost $500–$5.000. LoRA- en QLoRA-technieken verlagen deze kosten met nog eens 5–10×. Fine-tuning is toegankelijk voor vrijwel elk team met enkele honderden dollars.
Waarom is GPT-4-training zo duur?
Schaal. GPT-4 werd naar verluidt getraind op 13 biljoen tokens met 10.000+ A100 GPU’s gedurende ongeveer 100 dagen. Tegen A100-marktplaatstarieven (~$1,00/uur) is 10.000 GPU’s gedurende 2.400 uur $24 miljoen aan compute alleen — en de werkelijke kosten waren hoger vanwege trainingsherstartten, hyperparametertuning en infrastructuuroverhead.
Kan ik een nuttig AI-model trainen voor minder dan $1.000?
Ja. Fine-tuning van bestaande open-source modellen (Llama 3, Mistral) op domeinspecifieke data kan worden gedaan voor $50–$500. Het trainen van een klein model (1B–3B parameters) vanaf nul kost $1.000–$5.000. De sleutel is het benutten van voorgetrainde modellen en efficiënte technieken zoals LoRA in plaats van trainen vanaf nul.
Hoe beïnvloeden trainingskosten de AI-markt?
Hoge trainingskosten creëren toetredingsbarrières — alleen goed gefinancierde organisaties kunnen frontier-modellen trainen. Dit concentreert macht bij een paar labs (OpenAI, Anthropic, Google, Meta). Echter, open-source modellen (Llama, Mistral, DeepSeek) en dalende fine-tuningkosten democratiseren de toegang tot capabele AI. De trainingskosten-barrière is hoog voor frontier-modellen maar laag voor toegepaste AI.
Zullen trainingskosten blijven stijgen?
Totale uitgaven aan frontier-training zullen waarschijnlijk blijven stijgen (richting $1B+) omdat labs streven naar grotere, meer capabele modellen. Maar de kosten om een bepaald prestatieniveau te bereiken dalen snel — wat $79M kostte in 2023 zal minder dan $10M kosten in 2026. Beide uitspraken zijn tegelijkertijd waar.
Hoe schat ik trainingskosten voor mijn project?
Vuistregel: een model met N miljard parameters getraind op T tokens vereist ongeveer (6 × N × T) FLOPs. Deel door de FLOP/s-snelheid van de GPU om GPU-uren te krijgen. Vermenigvuldig met het uurtarief. Voorbeeld: een 7B-model getraind op 1T tokens heeft ~42 × 10^18 FLOPs nodig. Een H100 levert ~990 TFLOPS (BF16). Dat is ruwweg 11.800 GPU-uren, of ongeveer $17.700 tegen $1,50/uur marktplaastarief. Tel 30–50% op voor overhead (herstartten, tuning, evaluatie).