I numeri principali: quanto costano realmente i modelli di frontiera
Addestrare un modello AI di frontiera e uno dei progetti ingegneristici piu costosi nella storia umana. Ecco i numeri reali:
| Modello | Anno | Costo stimato addestramento | Hardware GPU | Durata addestramento |
|---|---|---|---|---|
| GPT-3 (175B) | 2020 | ~$4,6 milioni | ~1.000 GPU V100 | ~34 giorni |
| PaLM (540B) | 2022 | ~$12 milioni | 6.144 chip TPU v4 | ~50 giorni |
| GPT-4 (~1,8T MoE) | 2023 | ~$79 milioni | 10.000+ GPU A100 | ~100 giorni |
| Gemini Ultra | 2024 | ~$191 milioni | 16.384 chip TPU v5 | ~130 giorni |
| Llama 3.1 405B | 2024 | ~$60 milioni | 16.384 GPU H100 | ~54 giorni |
| DeepSeek R1 | 2025 | ~$294.000 | ~2.000 GPU H800 | ~55 giorni |
Il numero di DeepSeek R1 spicca. Mentre i laboratori di frontiera spendono centinaia di milioni, DeepSeek ha raggiunto prestazioni competitive per meno di $300.000 utilizzando ottimizzazioni aggressive di efficienza — dimostrando che il costo non e puramente una funzione della qualita del modello.
Analisi dei costi di addestramento: calcolo, dati e ingegneria
Il costo di addestramento non e solo noleggio GPU. Ecco dove vanno realmente i soldi:
Il calcolo GPU (65%) e il costo dominante. Per un addestramento da $79M, circa $51 milioni vanno nel noleggio GPU o nei costi hardware ammortizzati. Questa e la componente di costo piu sensibile alla scelta del fornitore e all’efficienza hardware.
La preparazione dei dati (15%) include web crawling, filtraggio, deduplicazione, tokenizzazione e etichettatura umana per RLHF. I dati di alta qualita sono sempre piu costosi — i dati sintetici e le pipeline automatizzate stanno riducendo i costi ma non eliminandoli.
L’ingegneria (12%) copre i ricercatori ML, gli ingegneri infrastrutturali e il personale di supporto che progettano, eseguono e risolvono problemi di addestramento. I migliori ricercatori AI hanno compensi annuali superiori a $1M. Un ciclo di addestramento di frontiera richiede un team di 20-50+ ingegneri per mesi.
L’infrastruttura (8%) include storage (petabyte di dati di addestramento), rete ad alta velocita (400 GbE tra i nodi), software di orchestrazione e monitoraggio. Spesso sottostimata nei budget iniziali.
Il paradosso dei costi: perche la spesa cresce mentre i costi unitari crollano
Ecco la realta controintuitiva: i costi totali di addestramento crescono esponenzialmente mentre il costo per unita di calcolo cala esponenzialmente.
- La spesa totale cresce di 2,4 volte all’anno — i laboratori addestrano modelli piu grandi su piu dati
- Il costo per FLOP cala di circa 10 volte all’anno — hardware migliore, algoritmi migliori
- Il costo di addestramento come percentuale del fatturato e in aumento — anche le aziende da trilioni di dollari sentono la pressione
Questo paradosso esiste perche i laboratori scalano piu velocemente di quanto i guadagni di efficienza possano compensare. Ogni nuova generazione di modelli e 5-10 volte piu grande della precedente, mentre i guadagni di efficienza riducono i costi per FLOP di 2-3 volte per generazione. L’effetto netto: piu spesa nonostante un calcolo piu economico.
Cosa significa per la domanda di GPU: Anche se le singole GPU diventano piu potenti ed efficienti, il numero totale di GPU richieste per l’addestramento di frontiera continua a crescere. Questo sostiene la domanda — e il potere di prezzo — dei fornitori di infrastruttura GPU.
Costi di addestramento per dimensione del modello: da 7B a 1T+ parametri
Non tutti addestrano modelli di frontiera. Ecco quanto costa l’addestramento a diverse scale:
| Dimensione modello | Calcolo tipico di addestramento | Costo stimato (H100 marketplace) | Costo stimato (AWS) |
|---|---|---|---|
| 1B parametri | ~1.000 ore-GPU | ~$1.500-$2.500 | ~$4.000-$7.000 |
| 7B parametri | ~10.000 ore-GPU | ~$15.000-$25.000 | ~$40.000-$70.000 |
| 13B parametri | ~25.000 ore-GPU | ~$37.500-$62.500 | ~$100.000-$175.000 |
| 70B parametri | ~200.000 ore-GPU | ~$300.000-$500.000 | ~$800.000-$1,4M |
| 405B parametri | ~1.500.000 ore-GPU | ~$2,2M-$3,7M | ~$6M-$10,5M |
| 1T+ (frontiera) | ~10.000.000+ ore-GPU | ~$15M-$25M | ~$40M-$70M |
Nota: queste sono stime approssimative. I costi effettivi variano significativamente in base all’efficienza di addestramento, qualita dei dati, fallimenti nell’ottimizzazione degli iperparametri e utilizzo hardware.
La differenza di costo di 2-3 volte tra marketplace e hyperscaler e coerente a tutte le scale. Per una startup che addestra un modello 7B, e la differenza tra $15K e $40K — significativa ma gestibile. Per un laboratorio di frontiera che addestra un modello 1T+, sono decine di milioni di dollari.
Come la scelta del fornitore impatta i budget di addestramento
Dove si noleggiano le GPU e una delle decisioni di costo a piu alta leva nell’AI:
| Tipo di fornitore | Costo mensile H100 (24/7) | Costo 12 mesi | Risparmio vs. AWS |
|---|---|---|---|
| AWS (on-demand) | ~$2.800 | ~$33.600 | — |
| Cloud specializzato (Lambda) | ~$2.150 | ~$25.800 | 23% |
| Marketplace (host verificato) | ~$1.150 | ~$13.800 | 59% |
| Riservato/con impegno | ~$1.700 | ~$20.400 | 39% |
Per un ciclo di addestramento da 1.000 ore-GPU, la differenza tra AWS on-demand e un marketplace e di circa $2.000. Scalando a un ciclo da 100.000 ore-GPU, la differenza e di $200.000. A scala di frontiera, la scelta del fornitore impatta i budget di milioni.
Per confronti dettagliati dei prezzi su tutti i principali fornitori, consultare la nostra guida ai prezzi GPU cloud. Per capire quale modello GPU scegliere, consultare la nostra guida alle migliori GPU per AI.
Punto chiave: Molti team usano per default il proprio fornitore cloud esistente (AWS, GCP, Azure) per l’addestramento perche e comodo. Questa comodita puo costare il 40-60% in piu rispetto alle alternative marketplace. Per cicli di addestramento superiori a $10.000, i 30 minuti spesi per configurare un account marketplace si ripagano centinaia di volte.
Innovazioni in efficienza: addestrare modelli migliori spendendo meno
L’esempio di DeepSeek R1 ($294.000 per prestazioni competitive) illustra che la spesa a forza bruta non e l’unico percorso. Tecniche chiave di efficienza nel 2026:
Mixture of Experts (MoE): Solo un sottoinsieme dei parametri del modello si attiva per input, riducendo il calcolo per forward pass di 4-8 volte. GPT-4 utilizzerebbe MoE — un modello da ~1,8T parametri di cui solo ~280B si attivano per token. Questo riduce drasticamente i requisiti FLOP di addestramento per parametro effettivo.
Addestramento con consapevolezza della quantizzazione: Addestrare in precisione inferiore (BF16, FP8) fin dall’inizio riduce i requisiti di memoria e calcolo di 2-4 volte con impatto minimo sulla qualita. Le GPU NVIDIA Blackwell supportano nativamente l’addestramento FP4.
Qualita dei dati rispetto alla quantita: La ricerca di OpenAI mostra che addestrare su dataset piu piccoli e di qualita superiore puo eguagliare modelli addestrati su 10 volte piu dati di qualita inferiore. L’investimento nella curatela dei dati riduce i requisiti di calcolo.
Innovazioni architetturali: Tecniche come Ring Attention (per contesto lungo), FlashAttention (per efficienza della memoria) e decodifica speculativa (per inferenza piu veloce) compongono i guadagni di efficienza. Ogni generazione di tecniche riduce il calcolo necessario per un dato livello di qualita.
Distillazione: Addestrare un modello “studente” piu piccolo per imitare un modello “insegnante” piu grande puo raggiungere l’80-95% delle prestazioni dell’insegnante a un costo di addestramento e inferenza 10-100 volte inferiore.
Proiezioni: dove si dirigono i costi di addestramento (2026-2028)
Il limite superiore continua a salire. Dario Amodei di Anthropic ha dichiarato che i modelli di frontiera potrebbero costare $10 miliardi da addestrare entro il 2028. Se un singolo modello costera effettivamente tanto dipende dai guadagni di efficienza e dall’economia dei rendimenti decrescenti.
Il limite inferiore continua a scendere. Allo stesso tempo, il costo per addestrare un modello “equivalente a GPT-4” continua a calare — da $79M nel 2023 a una stima di $5-$10M nel 2026 utilizzando hardware e tecniche di efficienza di generazione attuale. Cio che era costoso ai livelli di frontiera due anni fa diventa raggiungibile per startup ben finanziate.
L’implicazione per la domanda GPU: Entrambe le tendenze sostengono la domanda di GPU. I laboratori di frontiera necessitano di piu GPU per modelli piu grandi. Le organizzazioni piu piccole necessitano di GPU per addestrare cio che era recentemente impossibile. Il mercato totale indirizzabile per il calcolo di addestramento si espande in entrambe le direzioni.
Per come i costi di inferenza seguono un declino simile ma ancora piu ripido, consultare la nostra analisi dell’economia dell’inferenza. Per indicazioni di budget specifiche per startup, consultare la nostra guida al calcolo per startup AI.
Domande frequenti
Quanto costa fare il fine-tuning di un modello?
Il fine-tuning e drasticamente piu economico del pre-addestramento. Il fine-tuning di un modello 7B costa circa $50-$500 su un marketplace GPU (qualche centinaio di ore-GPU). Il fine-tuning di un modello 70B costa $500-$5.000. Le tecniche LoRA e QLoRA riducono questi costi di un ulteriore 5-10 volte. Il fine-tuning e accessibile a praticamente qualsiasi team con qualche centinaio di dollari.
Perche l’addestramento di GPT-4 e cosi costoso?
La scala. GPT-4 sarebbe stato addestrato su 13 trilioni di token utilizzando 10.000+ GPU A100 per circa 100 giorni. Alle tariffe marketplace delle A100 (~$1,00/ora), 10.000 GPU per 2.400 ore sono $24 milioni in solo calcolo — e i costi effettivi erano piu alti a causa di riavvii dell’addestramento, ottimizzazione degli iperparametri e overhead infrastrutturale.
Si puo addestrare un modello AI utile per meno di $1.000?
Si. Il fine-tuning di modelli open-source esistenti (Llama 3, Mistral) su dati specifici del dominio puo essere fatto per $50-$500. Addestrare un piccolo modello (1B-3B parametri) da zero costa $1.000-$5.000. La chiave e sfruttare modelli pre-addestrati e tecniche efficienti come LoRA anziche addestrare da zero.
Come influisce il costo di addestramento sul mercato AI?
Gli alti costi di addestramento creano barriere all’ingresso — solo organizzazioni ben finanziate possono addestrare modelli di frontiera. Questo concentra il potere tra pochi laboratori (OpenAI, Anthropic, Google, Meta). Tuttavia, i modelli open-source (Llama, Mistral, DeepSeek) e il calo dei costi di fine-tuning stanno democratizzando l’accesso a un’AI capace. La barriera dei costi di addestramento e alta per i modelli di frontiera ma bassa per l’AI applicata.
I costi di addestramento continueranno a salire?
La spesa totale per l’addestramento di frontiera continuera probabilmente a salire (verso $1B+) perche i laboratori puntano a modelli piu grandi e capaci. Ma il costo per raggiungere un dato livello di prestazioni sta calando rapidamente — cio che costava $79M nel 2023 costera meno di $10M entro il 2026. Entrambe le affermazioni sono simultaneamente vere.
Come si stimano i costi di addestramento per il proprio progetto?
Regola empirica: un modello con N miliardi di parametri addestrato su T token richiede circa (6 x N x T) FLOP. Dividere per il tasso FLOP/s della GPU per ottenere le ore-GPU. Moltiplicare per la tariffa oraria. Esempio: un modello 7B addestrato su 1T token necessita di ~42 x 10^18 FLOP. Una H100 offre ~990 TFLOPS (BF16). Sono circa 11.800 ore-GPU, ovvero circa $17.700 alla tariffa marketplace di $1,50/ora. Aggiungere il 30-50% per overhead (riavvii, ottimizzazione, valutazione).