Prezzi GPU cloud: il quadro completo
La tariffa oraria pubblicizzata di una GPU cloud non e quello che si paga realmente. I costi reali delle GPU cloud includono fee nascoste, penalita sulla granularita della fatturazione e overhead infrastrutturale che possono gonfiare la bolletta del 20-40% oltre il prezzo pubblicato.
Questa guida si concentra su cio che altri confronti di prezzo trascurano: il costo totale dell’esecuzione di un carico di lavoro GPU, non solo il prezzo da listino. Confrontiamo tre tipi di fornitori, riveliamo i costi nascosti e forniamo cinque strategie concrete per ridurre la spesa GPU.
Per confronti di specifiche GPU e raccomandazioni per carichi di lavoro, consultare la nostra guida alle migliori GPU per AI. Questo articolo si concentra su fornitori e prezzi — dove si noleggia, non cosa si noleggia.
Tre tipi di fornitori GPU cloud
Il mercato GPU cloud ha tre livelli distinti, ciascuno con strutture di prezzo, compromessi e clienti target diversi.
Hyperscaler (AWS, Google Cloud, Azure)
I principali fornitori cloud offrono istanze GPU come parte della loro ampia piattaforma infrastrutturale. Si ottengono SLA enterprise, regioni globali, profonda integrazione con servizi gestiti (storage, piattaforme ML, monitoraggio) e disponibilita garantita per istanze riservate.
Il premium: $3,00-$6,98/ora per una H100 on-demand. Le istanze riservate (impegni da 1 a 3 anni) riducono questo del 30-50%, ma richiedono un vincolo a lungo termine.
Cloud GPU specializzati (Lambda, CoreWeave)
Focalizzati esclusivamente sull’infrastruttura GPU. Questi fornitori offrono prezzi competitivi ($2,00-$3,00/ora per H100), configurazioni ottimizzate per carichi AI e supporto focalizzato sull’AI — ma meno servizi gestiti rispetto agli hyperscaler.
Marketplace GPU (GPUnex, Vast.ai, RunPod)
Aggregano capacita GPU da centinaia di data center distribuiti. Mettendo in comune l’offerta di molti fornitori, i marketplace offrono i prezzi piu competitivi ($1,49-$2,50/ora per H100) con fatturazione flessibile — spesso al secondo anziche all’ora. I compromessi includono affidabilita variabile e strumenti meno integrati.
Confronto prezzi per modello GPU
Ecco quanto costa effettivamente ogni GPU per tipo di fornitore all’inizio del 2026:
| Modello GPU | Hyperscaler on-demand | Hyperscaler riservato | Cloud specializzato | Marketplace GPU |
|---|---|---|---|---|
| H100 80GB | $3,00-$6,98/ora | $2,00-$4,50/ora | $2,00-$3,00/ora | $1,49-$2,50/ora |
| A100 80GB | $1,50-$3,50/ora | $1,00-$2,50/ora | $0,80-$1,50/ora | $0,72-$1,50/ora |
| L40S 48GB | $1,20-$2,50/ora | $0,80-$1,80/ora | $0,80-$1,50/ora | $0,60-$1,20/ora |
| L4 24GB | $0,50-$1,00/ora | $0,30-$0,70/ora | $0,30-$0,60/ora | $0,20-$0,50/ora |
| RTX 4090 24GB | N/D (non offerta) | N/D | $0,40-$0,80/ora | $0,40-$0,80/ora |
Osservazione chiave: Il divario di prezzo tra hyperscaler on-demand e marketplace e di 2-4,7 volte per lo stesso hardware GPU. Per una H100, la differenza tra $6,98/ora (AWS on-demand) e $1,49/ora (marketplace spot) e di $5,49/ora — che si accumula a $4.008/mese per una singola GPU in funzione 24/7.
Costi nascosti che gonfiano la bolletta GPU
La tariffa oraria GPU e solo una parte della storia. Cinque categorie di costi nascosti sorprendono regolarmente i team:
1. Fee di uscita dati (egress)
Spostare dati fuori dalla rete di un fornitore cloud costa — tipicamente $0,05-$0,12 per GB. Addestrare un modello che scarica 1 TB di dati di addestramento ed esporta checkpoint regolarmente puo aggiungere $50-$120 in fee di uscita per ciclo di addestramento. I workflow multi-cloud (addestramento su un fornitore, inferenza su un altro) moltiplicano questi costi.
2. Costi di storage
Le istanze GPU hanno bisogno di spazio disco per dataset, checkpoint del modello e log. Lo storage cloud costa $0,02-$0,08/GB/mese. Un dataset da 5 TB archiviato per 3 mesi costa $300-$1.200 — invisibile nella tariffa oraria GPU ma molto visibile in bolletta.
3. Rete e bilanciamento del carico
L’inferenza in produzione richiede bilanciatori di carico, gateway API e rete inter-nodo. Questi servizi aggiungono $50-$200+/mese a seconda del volume di traffico. I cluster di addestramento multi-GPU comportano costi aggiuntivi per la rete inter-nodo ad alta velocita.
4. Impegni minimi e arrotondamento
Alcuni fornitori fatturano in incrementi orari — un lavoro di 35 minuti costa quanto uno di 60 minuti. La fatturazione al secondo (offerta da alcuni marketplace) elimina questo spreco. Per carichi intermittenti con molti lavori brevi, la fatturazione oraria puo sprecare il 15-30% della spesa in tempo non utilizzato.
5. Fee per API e servizi gestiti
I servizi ML gestiti (SageMaker, Vertex AI) addebitano fee aggiuntive oltre al calcolo GPU. Queste possono aggiungere il 10-30% al costo base della GPU per la comodita di pipeline di addestramento e deployment gestite.
Punto chiave: Un carico di lavoro che costa $3,15/ora in calcolo GPU puo costare $4,00-$4,50/ora in totale quando si aggiungono uscita dati, storage, rete e fee di gestione. Calcolare sempre il costo totale del proprio carico di lavoro, non solo la voce GPU.
Come ridurre i costi GPU cloud del 40%
Cinque strategie comprovate che, combinate, possono ridurre la spesa GPU totale del 30-40%:
1. Usare istanze spot/preemptible (risparmio 15-20%)
Le istanze spot offrono sconti del 40-60% rispetto ai prezzi on-demand. Il compromesso: possono essere interrotte con breve preavviso (tipicamente da 2 minuti a 2 ore). Per carichi tolleranti ai guasti — addestramento con checkpointing, elaborazione batch, inferenza non urgente — le istanze spot sono la singola leva di costo piu grande.
Funziona meglio per: Addestramento modelli con checkpoint regolari, preprocessing dati, inferenza batch, sperimentazione.
Non funziona per: Inferenza in produzione per utenti live, lavori time-critical, carichi che non tollerano interruzioni.
2. Dimensionare correttamente la GPU (risparmio 8-12%)
Molti team scelgono per default la GPU piu potente “per sicurezza”. Un carico che gira bene su una A100 ($0,72/ora) non ha bisogno di una H100 ($3,15/ora). La nostra guida alle migliori GPU per AI fornisce un framework decisionale per carico di lavoro — abbinare il modello GPU al compito puo ridurre i costi del 50%+ per carichi sovradimensionati.
Errori comuni: Usare H100 per inferenza quando la L40S e sufficiente. Usare A100 per il fine-tuning di modelli piccoli quando la RTX 4090 funziona. Eseguire inferenza batch su istanze on-demand quando lo spot e disponibile.
3. Schedulare e auto-scalare (risparmio 5-8%)
Le istanze GPU in funzione 24/7 quando il team lavora 8 ore/giorno sprecano due terzi della spesa. Politiche di auto-scaling che avviano GPU per lavori di addestramento e le terminano quando inattive possono recuperare sprechi significativi. Anche un semplice scheduling — “GPU accese alle 8, spente alle 20” — risparmia il 50% sulle istanze di sviluppo.
4. Migrare i carichi ai marketplace (risparmio 10-15%)
Per carichi che non richiedono servizi gestiti specifici degli hyperscaler, passare a un marketplace GPU puo far risparmiare 3-6 volte sul calcolo. Il requisito chiave: il carico deve essere containerizzato (Docker) e non dipendente da API specifiche del fornitore (SageMaker, Vertex AI).
5. Usare capacita riservata/con impegno (risparmio 5-10% aggiuntivo)
Per carichi prevedibili e sostenuti (inferenza in produzione, addestramento continuo), gli impegni di capacita riservata offrono sconti del 30-50% rispetto ai prezzi on-demand. Il compromesso e l’impegno — tipicamente 1-3 anni. Combinare capacita riservata per il carico base con spot/marketplace per il carico variabile.
Analisi fornitore per fornitore
AWS (Amazon Web Services)
Istanze GPU: P5 (H100), P4 (A100), G5 (A10G), G6 (L4). Prezzi: H100 on-demand: ~$4,50-$6,98/ora. Riservato (1 anno): ~$3,00-$4,50/ora. Spot: ~$1,50-$2,50/ora. Punti di forza: Ecosistema di servizi gestiti piu ampio (SageMaker, EKS, S3), disponibilita globale, supporto enterprise. Attenzione a: Fee di uscita ($0,09/GB), livelli di prezzo complessi, fluttuazioni di disponibilita per on-demand.
Google Cloud Platform
Istanze GPU: A3 (H100), A2 (A100), G2 (L4). Prezzi: H100 on-demand: ~$3,50-$5,50/ora. Con impegno (1 anno): ~$2,50-$3,50/ora. Spot: ~$1,50-$2,00/ora. Punti di forza: Valida alternativa TPU, eccellente integrazione JAX/TensorFlow, piattaforma gestita Vertex AI, prezzi spot competitivi. Attenzione a: Flotta GPU piu piccola di AWS, meno disponibilita in alcune regioni.
Microsoft Azure
Istanze GPU: ND H100 (H100), NC A100 (A100), NC T4 (T4). Prezzi: H100 on-demand: ~$3,00-$5,00/ora. Riservato (1 anno): ~$2,00-$3,50/ora. Punti di forza: Integrazione OpenAI (Azure OpenAI Service), forte identita/sicurezza enterprise, capacita cloud ibride. Attenzione a: La disponibilita GPU puo essere limitata nelle regioni piu richieste.
Marketplace GPU
GPU disponibili: H100, A100, L40S, L4, RTX 4090 e altre. Prezzi: H100: $1,49-$2,50/ora. A100: $0,72-$1,50/ora. RTX 4090: $0,40-$0,80/ora. Punti di forza: Prezzi piu bassi, fatturazione flessibile (al secondo su alcune piattaforme), nessun impegno, ampia selezione GPU incluse schede consumer. Attenzione a: Affidabilita variabile a seconda del fornitore, meno strumenti gestiti, potrebbe richiedere piu configurazione self-service.
Quando usare quale tipo di fornitore
| Scenario | Miglior tipo di fornitore | Perche |
|---|---|---|
| Inferenza enterprise in produzione | Hyperscaler | SLA, disponibilita globale, servizi gestiti |
| Addestramento su larga scala (1000+ GPU) | Hyperscaler o cloud specializzato | Capacita garantita, rete NVLink |
| Addestramento ottimizzato per costi | Marketplace GPU (spot) | Prezzi piu bassi, checkpointing gestisce le interruzioni |
| Sviluppo e sperimentazione | Marketplace GPU | Fatturazione al secondo, nessun impegno, iterazione economica |
| Team piccolo / startup | Marketplace GPU | Barriera piu bassa, scaling flessibile, nessun minimo |
| Inferenza batch | Marketplace GPU o spot | Tollera le interruzioni, sensibile al prezzo |
| Carichi regolamentati (finanza, sanita) | Hyperscaler | Certificazioni di conformita, tracce di audit |
Per la questione noleggio-vs-acquisto — se il noleggio cloud ha piu senso della proprieta dell’hardware — consultare il nostro confronto dettagliato dei costi. Per startup che definiscono il loro primo budget GPU, consultare la nostra guida ai costi di calcolo per startup AI.
Domande frequenti
Qual e il modo piu economico per noleggiare una H100?
I marketplace GPU offrono le tariffe H100 piu basse a $1,49-$2,50/ora. Le istanze spot degli hyperscaler vengono subito dopo a $1,50-$2,50/ora ma possono essere interrotte. L’opzione affidabile piu economica e un marketplace con un fornitore ad alto punteggio di uptime. Per carichi non time-critical, i prezzi spot su qualsiasi piattaforma offrono gli sconti piu profondi.
I costi nascosti sono davvero cosi significativi?
Si. Per un carico di addestramento tipico, i costi nascosti (uscita dati, storage, rete) aggiungono il 20-40% sopra la bolletta del calcolo GPU. Un’istanza H100 a $3,15/ora che esegue un addestramento con 2 TB di trasferimento dati e 500 GB di storage checkpoint puo effettivamente costare $4,00-$4,50/ora in totale. Stimare sempre il costo totale del carico di lavoro, non solo la tariffa GPU oraria.
Dovrei usare un fornitore o piu fornitori?
Piu fornitori. Usare i marketplace GPU per carichi sensibili ai costi (sviluppo, elaborazione batch, inferenza). Usare gli hyperscaler per inferenza in produzione e carichi regolamentati. Usare i prezzi spot su tutti i fornitori per lavori tolleranti ai guasti. Diversificare previene il vendor lock-in e permette di ottimizzare i costi a ogni livello.
Cos’e la fatturazione al secondo e conta?
La fatturazione al secondo addebita solo per il tempo esatto in cui la GPU e attiva. La fatturazione oraria arrotonda per eccesso — un lavoro di 35 minuti costa quanto 60 minuti. Per carichi con molti lavori brevi (inferenza, sperimentazione, CI/CD), la fatturazione al secondo risparmia il 15-30%. Per lavori di addestramento lunghi, la differenza e trascurabile.
Come sono cambiati i prezzi GPU nell’ultimo anno?
I prezzi delle H100 sono calati del 44% tra giugno 2024 e giugno 2025, trainati dall’espansione dell’offerta e dalla concorrenza dei marketplace. I prezzi delle A100 sono calati ancora di piu con l’invecchiamento della GPU. I prezzi dovrebbero continuare a calare gradualmente man mano che NVIDIA e AMD aumentano la produzione, sebbene le GPU di nuova generazione (B200, Rubin) avranno prezzi premium al lancio. Per un contesto di mercato piu ampio, consultare la nostra analisi di mercato OpenAI-NVIDIA.