Cos’e una GPU? La risposta in 30 secondi
Una GPU (Graphics Processing Unit) e un processore specializzato progettato per eseguire migliaia di operazioni matematiche simultaneamente. Sebbene sia stata originariamente inventata per renderizzare pixel su uno schermo, la GPU si e evoluta nel motore computazionale alla base dell’intelligenza artificiale, della ricerca scientifica, dei veicoli autonomi e molto altro.
Ecco il modo piu semplice per comprendere la differenza tra una CPU e una GPU. Si pensi a un’orchestra. Una CPU e il direttore d’orchestra — straordinariamente abile, coordina arrangiamenti complessi, legge l’intera partitura, gestisce i cambi di tempo e prende decisioni di alto livello in tempo reale. Ma un direttore non suona strumenti. Ora si immaginino 16.000 musicisti, ciascuno dei quali suona una singola nota semplice esattamente al momento giusto. Individualmente, ogni nota e banale. Insieme, producono una sinfonia di calcolo — miliardi di operazioni intrecciate in un risultato coerente. Questa e una GPU.
Questo e importante perche le tecnologie che definiscono la nostra era — modelli linguistici di grandi dimensioni, ray tracing in tempo reale, simulazioni per la scoperta di farmaci, modellazione climatica — condividono tutte un tratto comune: richiedono enormi volumi di operazioni matematiche semplici e ripetitive eseguite simultaneamente. Le CPU non sono mai state progettate per questo. Le GPU si.
I numeri parlano chiaro. Il mercato globale delle GPU era valutato $101,5 miliardi nel 2025 ed e previsto che raggiunga $1,7 trilioni entro il 2035, con un tasso di crescita annuo composto del 32,6% (Precedence Research). Le GPU sono passate da un componente di nicchia all’interno dei PC da gaming all’infrastruttura fondamentale dell’economia dell’AI.
Come funziona realmente una GPU: l’elaborazione parallela spiegata
Per comprendere una GPU, occorre capire l’elaborazione parallela — e perche e fondamentalmente diversa da cio che fa una CPU.
Una CPU esegue le operazioni in sequenza. Ha un numero ridotto di core estremamente potenti (tipicamente 8-24 su un chip desktop) che possono ciascuno gestire logiche complesse e ramificate. E progettata per la versatilita: eseguire un sistema operativo, gestire l’I/O dei file, eseguire percorsi di codice condizionali. Un core CPU e come un ingegnere esperto che puo risolvere qualsiasi tipo di problema, ma solo un problema alla volta.
Una GPU adotta l’approccio opposto. Integra migliaia di core semplici che gestiscono ciascuno una piccola porzione di un problema piu grande — tutto contemporaneamente. Questa e l’elaborazione parallela. Invece di un esperto che risolve un problema, si hanno migliaia di lavoratori che risolvono ciascuno un pezzo di un puzzle simultaneamente.
CUDA Core
I cavalli di battaglia di una GPU NVIDIA sono chiamati CUDA core (Compute Unified Device Architecture). Ogni CUDA core e un processore semplice capace di eseguire un’operazione in virgola mobile o intera per ciclo di clock. Cio che li rende potenti e la quantita. La NVIDIA H100, il cavallo di battaglia dell’infrastruttura AI moderna, ha 16.896 CUDA core. Una RTX 4090 consumer ne ha 16.384. Quando un’operazione come il rendering di un frame o l’addestramento di una rete neurale puo essere suddivisa in migliaia di sotto-operazioni indipendenti, tutti quei core si attivano contemporaneamente.
Tensor Core
Introdotti con l’architettura Volta nel 2017, i Tensor Core sono unita specializzate progettate per la moltiplicazione e accumulazione di matrici — l’operazione matematica al cuore di ogni rete neurale. Mentre un CUDA core elabora un numero alla volta, un Tensor Core elabora un’intera piccola matrice (ad esempio, un blocco 4x4) in una singola operazione. La H100 contiene 528 Tensor Core, ciascuno capace di calcoli a precisione mista (FP8, FP16, TF32) che accelerano drasticamente l’addestramento e l’inferenza AI.
Ecco perche le GPU dominano l’AI: le reti neurali sono, nella loro essenza, vaste sequenze di moltiplicazioni di matrici. Ogni livello di un modello transformer — l’architettura dietro GPT-4, Claude e Gemini — moltiplica matrici di input per matrici di pesi. Questa operazione e embarrassingly parallel (parallelizzabile in modo banale), il che significa che puo essere suddivisa tra migliaia di processori con praticamente nessun overhead di coordinamento. L’architettura GPU si adatta a questo carico di lavoro con la precisione con cui una chiave si inserisce in una serratura.
RT Core
I Ray Tracing core gestiscono la fisica della luce — tracciando il percorso di milioni di raggi individuali mentre rimbalzano, si rifrangono e si disperdono in una scena virtuale. Introdotti con l’architettura Turing nel 2018, gli RT Core scaricano questa operazione computazionalmente impegnativa dai CUDA core, consentendo il rendering fotorealistico in tempo reale nei giochi e nella visualizzazione professionale.
Insieme, CUDA Core, Tensor Core e RT Core formano una triade che rende le GPU moderne sufficientemente versatili per gaming, AI e calcolo scientifico all’interno di un singolo chip.
La cronologia delle GPU: dai pixel ai petaflop (1999-2026)
La trasformazione della GPU da periferica grafica al chip piu rilevante nell’informatica ha richiesto solo 27 anni.
-
1999 — NVIDIA rilascia la GeForce 256 e conia il termine “GPU”. E il primo chip a gestire i calcoli di trasformazione e illuminazione sulla scheda grafica, scaricando il lavoro dalla CPU.
-
2006 — NVIDIA lancia CUDA, un framework di programmazione che consente agli sviluppatori di scrivere codice generico per le GPU. Questa singola decisione trasforma la GPU da un chip esclusivamente grafico in una piattaforma di calcolo parallelo.
-
2012 — AlexNet di Alex Krizhevsky vince la competizione ImageNet con un margine storico, utilizzando due GPU NVIDIA GTX 580 per addestrare una rete neurale convoluzionale profonda. Inizia la rivoluzione del deep learning.
-
2016 — Jensen Huang consegna personalmente il primo sistema DGX-1 a OpenAI. Il sistema contiene otto GPU P100 e 170 teraflop di potenza di calcolo — un segnale precoce della centralita della GPU nella ricerca AI.
-
2017 — L’architettura Volta introduce i Tensor Core, silicio appositamente costruito per le operazioni su matrici. Le prestazioni dell’addestramento AI fanno un balzo in avanti significativo.
-
2020 — La A100 (Ampere) viene lanciata con Tensor Core di terza generazione, supportando i formati TF32 e FP64 che accelerano sia l’AI che il calcolo scientifico. Diventa la GPU standard per i data center di tutto il mondo.
-
2022 — Ethereum passa al Proof of Stake, ponendo effettivamente fine all’era del mining su GPU. Milioni di GPU inondano il mercato secondario, mentre NVIDIA si orienta decisamente verso i ricavi dei data center AI.
-
2024 — L’architettura Blackwell arriva con 208 miliardi di transistor, un Transformer Engine di seconda generazione e il supporto alla precisione FP4. La GPU B200 offre prestazioni di addestramento AI 4 volte superiori rispetto alla H100.
-
2025 — NVIDIA diventa la prima azienda nella storia a raggiungere una capitalizzazione di mercato di 4 trilioni di dollari, alimentata dalla domanda insaziabile di infrastruttura AI.
-
2026 — NVIDIA annuncia l’architettura Rubin — 336 miliardi di transistor, 50 PFLOPS di inferenza FP4 e memoria HBM4. Inizia la prossima era del calcolo GPU.
GPU vs. CPU: la differenza essenziale
GPU e CPU non sono concorrenti — sono complementari. Comprendere le loro differenze aiuta a scegliere lo strumento giusto per ogni carico di lavoro.
| Caratteristica | CPU | GPU |
|---|---|---|
| Numero di core | 8-128 core ad alte prestazioni | 1.000-16.896+ core semplici |
| Frequenza di clock | 3,0-5,8 GHz | 1,5-2,5 GHz |
| Tipo di memoria | DDR5 RAM di sistema (~50 GB/s) | HBM3/GDDR6X VRAM (fino a 3,35 TB/s) |
| Ideale per | Logica sequenziale, operazioni OS, database, codice ramificato | Carichi paralleli: AI, rendering, simulazioni |
| Architettura | Pochi core potenti, grandi cache, previsione dei salti | Migliaia di core semplici, alta larghezza di banda della memoria |
Il concetto chiave: le CPU ottimizzano la latenza (completare un singolo task il piu velocemente possibile), mentre le GPU ottimizzano il throughput (completare il maggior numero possibile di task al secondo).
Per un approfondimento sulle prestazioni GPU vs. CPU, benchmark e analisi dei costi, si legga il nostro confronto completo GPU vs. CPU.
Tipi di GPU: consumer, data center e mobile
Non tutte le GPU sono uguali. Coprono un ampio spettro di fattori di forma, budget energetici e fasce di prezzo.
Integrate vs. discrete
Le GPU integrate sono costruite all’interno del die della CPU e condividono la RAM principale del sistema. Le grafiche integrate Intel UHD e AMD Radeon rientrano in questa categoria. Consumano poca energia e gestiscono le attivita quotidiane — riproduzione video, fotoritocco leggero, compositing del desktop — ma mancano della potenza necessaria per carichi di lavoro impegnativi.
Le GPU discrete sono chip autonomi con la propria VRAM dedicata, alimentazione e raffreddamento. Offrono prestazioni notevolmente superiori e sono necessarie per il gaming ad alte impostazioni, il lavoro 3D professionale e qualsiasi operazione AI o di calcolo.
GPU consumer
Le serie NVIDIA GeForce RTX (dalla RTX 4060 alla RTX 5090) e AMD Radeon RX (dalla RX 7600 alla RX 9070 XT) sono rivolte ai gamer e ai creatori di contenuti. I prezzi vanno da $250 a oltre $2.000. Queste GPU presentano frequenze di clock elevate, memoria GDDR6X e driver ottimizzati per giochi e software creativi.
GPU per data center
Le NVIDIA H100, A100, L40S e AMD MI300X sono progettate per l’intelligenza artificiale, il calcolo ad alte prestazioni (HPC) e l’inferenza su larga scala. Dispongono di VRAM massiva (80-192 GB), memoria HBM ultraveloce, interconnessioni NVLink e memoria con correzione degli errori. Un singolo modulo H100 SXM consuma fino a 700W e costa $25.000-$40.000.
GPU mobili e NPU
Smartphone e laptop utilizzano GPU mobili come Qualcomm Adreno e i core GPU Apple nei chip serie M e serie A. Sempre piu spesso, questi dispositivi includono anche NPU (Neural Processing Unit) dedicate, ottimizzate per operazioni AI sul dispositivo — riconoscimento delle immagini, elaborazione vocale e traduzione in tempo reale — con una frazione del consumo energetico di una GPU discreta.
GPU vs. scheda grafica
Un punto di confusione comune: la GPU e il chip di silicio stesso. Una scheda grafica e l’assemblaggio completo — chip GPU, moduli VRAM, sistema di raffreddamento, circuiti di alimentazione e PCB — che si inserisce nella scheda madre. Quando qualcuno dice “ho comprato una GPU”, quasi sempre intende la scheda grafica completa.
A cosa servono le GPU? 8 settori oltre il gaming
Il gaming ha costruito l’industria delle GPU, ma oggi rappresenta solo una frazione di cio che le GPU fanno. Ecco otto settori in cui la potenza di calcolo GPU e ora indispensabile.
1. AI e machine learning. Le GPU alimentano l’addestramento e l’inferenza dietro modelli linguistici di grandi dimensioni come GPT-4 e Claude, generatori di immagini come Stable Diffusion e i sistemi di raccomandazione che guidano Netflix e Spotify. L’addestramento di un LLM di frontiera richiede decine di migliaia di GPU in funzione per mesi. Senza il parallelismo delle GPU, l’AI moderna semplicemente non esisterebbe.
2. Sanita. L’analisi accelerata da GPU di scansioni MRI e TC sta riducendo i tempi di diagnosi da ore a minuti. Nella ricerca farmaceutica, le simulazioni di dinamica molecolare eseguite su cluster GPU stanno comprimendo i tempi di scoperta dei farmaci. Il framework BioNeMo di NVIDIA e stato implementato nelle principali aziende farmaceutiche per accelerare la previsione della struttura delle proteine e la chimica generativa.
3. Scienze climatiche. Il computer exascale JUPITER, uno dei sistemi piu potenti mai costruiti, esegue simulazioni climatiche globali a scala chilometrica su cluster GPU. I modelli di previsione meteorologica raggiungono oggi un’accuratezza delle previsioni a 10 giorni che solo un decennio fa avrebbe richiesto un mese di calcolo. La modellazione climatica accelerata da GPU sta trasformando il modo in cui governi e istituzioni si preparano ai cambiamenti ambientali.
4. Veicoli autonomi. Stellantis, Mercedes-Benz, Volvo e Lucid Motors utilizzano la piattaforma NVIDIA DRIVE per la percezione in tempo reale, la mappatura HD e il processo decisionale autonomo. Ogni veicolo a guida autonoma deve elaborare simultaneamente dati da telecamere, LiDAR, radar e sensori a ultrasuoni — una sfida di elaborazione parallela su misura per le GPU.
5. Digital twin. Siemens e NVIDIA Omniverse consentono alle aziende di costruire repliche virtuali basate sull’AI delle operazioni fisiche. PepsiCo ottimizza la logistica della catena di approvvigionamento, Foxconn simula i layout dei reparti produttivi e HD Hyundai modella le operazioni dei cantieri navali — tutto come digital twin alimentati da GPU che prevedono i risultati prima che vengano prese decisioni nel mondo reale.
6. Energia da fusione. Commonwealth Fusion Systems utilizza digital twin accelerati da GPU per simulare il comportamento del plasma all’interno dei reattori tokamak. I reattori a fusione generano condizioni piu calde del nucleo del sole, rendendo la sperimentazione fisica pericolosa e costosa. Le simulazioni GPU consentono agli ingegneri di iterare sui progetti dei reattori a un ritmo altrimenti impossibile.
7. Finanza. Le principali banche e hedge fund eseguono rilevamento delle frodi in tempo reale, simulazioni Monte Carlo per il rischio e strategie di trading algoritmico su cluster GPU. Una simulazione Monte Carlo che valuta milioni di scenari di mercato beneficia enormemente del parallelismo GPU — cio che potrebbe richiedere ore a un farm di CPU puo essere completato in secondi su un nodo multi-GPU.
8. Creazione di contenuti. Gli studi VFX di Hollywood, le societa di visualizzazione architettonica e gli sviluppatori di giochi si affidano alle GPU per rendering, compositing e produzione virtuale in tempo reale. La combinazione di Unreal Engine e GPU di fascia alta ha consentito agli stage di produzione virtuale (la tecnologia dietro The Mandalorian) di sostituire i tradizionali workflow con green screen nell’intera industria dell’intrattenimento.
Specifiche GPU decodificate: guida rapida per principianti
Le schede tecniche delle GPU possono essere opprimenti. Ecco cosa significa realmente ogni numero — e perche e importante.
VRAM (Video Random Access Memory) — La memoria a breve termine della GPU. La VRAM determina quanto grande puo essere un modello AI o quante texture ad alta risoluzione possono essere caricate contemporaneamente sulla scheda. La H100 ha 80 GB di HBM3 — sufficienti per contenere un modello da 70 miliardi di parametri interamente in memoria. Se il modello non entra nella VRAM, le prestazioni crollano o l’addestramento fallisce del tutto.
Larghezza di banda della memoria — Quanto velocemente i dati fluiscono tra la GPU e la sua memoria. La H100 raggiunge 3,35 TB/s. Si pensi alla capacita della VRAM come alla dimensione di un magazzino e alla larghezza di banda come all’ampiezza dell’autostrada che lo collega allo stabilimento. Un magazzino enorme non serve a nulla se la strada davanti e a corsia singola. Un’alta larghezza di banda garantisce che i core della GPU siano costantemente alimentati con dati.
Tensor Core — Unita specializzate per operazioni su matrici costruite per le operazioni che guidano le reti neurali. Eseguono calcoli a precisione mista (FP8, FP16, TF32) molto piu velocemente dei CUDA core generici. Quando un benchmark AI cita i “AI TOPS” (trilioni di operazioni al secondo) di una GPU, sta misurando il throughput dei Tensor Core.
Interconnessione (NVLink e InfiniBand) — Il tessuto di comunicazione che consente a piu GPU di condividere dati durante l’addestramento distribuito. L’addestramento di un modello linguistico di grandi dimensioni richiede da 256 a oltre 32.000 GPU che lavorano all’unisono. NVLink 4.0 sulla H100 offre 900 GB/s di larghezza di banda bidirezionale tra coppie di GPU, mentre la rete InfiniBand connette i nodi attraverso un cluster. Senza interconnessioni veloci, l’addestramento multi-GPU avrebbe colli di bottiglia nella comunicazione, non nel calcolo.
Confronto GPU per data center (2026)
| Specifica | H100 80GB SXM | A100 80GB | L40S 48GB | L4 24GB |
|---|---|---|---|---|
| VRAM | 80 GB | 80 GB | 48 GB | 24 GB |
| Tipo di memoria | HBM3 | HBM2e | GDDR6 | GDDR6 |
| Larghezza di banda | 3,35 TB/s | 2,0 TB/s | 864 GB/s | 300 GB/s |
| Tensor Core | 528 (4a Gen) | 432 (3a Gen) | 568 (4a Gen) | 240 (4a Gen) |
| Interconnessione | NVLink 4.0 | NVLink 3.0 | PCIe Gen4 | PCIe Gen4 |
| Ideale per | Addestramento LLM, HPC | Addestramento AI, inferenza | Inferenza, rendering | Inferenza leggera |
| Fascia di prezzo cloud | $1,49-$6,98/ora | $0,80-$3,50/ora | $0,80-$2,50/ora | $0,30-$1,00/ora |
Il panorama GPU: NVIDIA, AMD e Intel nel 2026
Tre aziende definiscono il mercato GPU nel 2026, ma le dinamiche competitive sono tutt’altro che equilibrate.
NVIDIA: la forza dominante
NVIDIA comanda il 92% del mercato delle GPU discrete e una quota ancora maggiore delle GPU AI per data center. La roadmap dell’azienda — Blackwell (2024) - Rubin (2026) - Feynman (2027+) — detta il ritmo per l’intero settore. Nel solo Q3 dell’anno fiscale 2026, il segmento data center di NVIDIA ha generato $30,77 miliardi di ricavi. Nel 2025, NVIDIA e diventata la prima azienda nella storia a superare una capitalizzazione di mercato di 4 trilioni di dollari. Il suo ecosistema software CUDA, che ha ormai quasi 20 anni, crea un profondo vantaggio competitivo: milioni di sviluppatori, migliaia di librerie ottimizzate e un’intera toolchain AI costruita sulla piattaforma NVIDIA.
AMD: lo sfidante in ascesa
La MI300X di AMD e emersa come un’alternativa credibile per i carichi di lavoro di inferenza AI, in particolare tra i fornitori cloud attenti ai costi. La prossima MI350X promette prestazioni 4 volte superiori rispetto alla MI300X, mentre la MI400 punta a un rilascio nel 2026. Lo stack software ROCm di AMD e migliorato significativamente ma e ancora indietro rispetto a CUDA in ampiezza delle librerie e adozione da parte della community. Per i clienti che cercano prezzi competitivi e flessibilita multi-vendor, AMD e un’opzione sempre piu praticabile.
Intel: entra in gara
L’acceleratore AI Gaudi 3 di Intel sta guadagnando terreno in specifici carichi di lavoro di inferenza, e la piattaforma Falcon Shores mira a unificare le capacita GPU e di calcolo AI in un’unica architettura. La quota di mercato di Intel rimane ridotta rispetto a NVIDIA e AMD, ma la sua strategia di prezzi aggressivi e l’integrazione con i propri servizi di fonderia la posizionano come potenziale elemento di rottura nei segmenti sensibili ai costi.
Una statistica sorprendente: oltre il 75% delle aziende Fortune 500 utilizza ora l’infrastruttura GPU NVIDIA in qualche forma — una testimonianza di quanto profondamente le GPU siano penetrate nell’informatica aziendale.
GPU, TPU o NPU: quale chip AI serve?
La GPU non e l’unico acceleratore AI. I TPU di Google e la crescente categoria delle NPU hanno ciascuno vantaggi distinti.
GPU (Graphics Processing Unit) — Il processore parallelo generico. Le GPU eccellono nell’addestramento AI, nei carichi di lavoro misti e in qualsiasi operazione che richieda flessibilita. Gli ecosistemi CUDA e ROCm supportano PyTorch, TensorFlow, JAX e praticamente ogni framework AI. Le GPU sono la scelta predefinita per la maggior parte dei team AI grazie alla loro versatilita e alla maturita del loro stack software.
TPU (Tensor Processing Unit) — Il chip personalizzato di Google costruito attorno ad array sistolici ottimizzati per le operazioni su matrici. I TPU sono eccellenti per l’inferenza a grandi batch e i carichi di lavoro nativi TensorFlow, in particolare su Google Cloud. Tuttavia, sono esclusivi di Google Cloud Platform, il che limita la flessibilita per i team che necessitano di distribuzioni multi-cloud o on-premises.
NPU (Neural Processing Unit) — Silicio costruito appositamente per l’inferenza AI sul dispositivo. Le NPU sono 40-60 volte piu efficienti dal punto di vista energetico rispetto alle GPU per operazioni edge come il riconoscimento vocale, la classificazione delle immagini e la traduzione in tempo reale. Si trovano negli smartphone (Apple Neural Engine, Qualcomm Hexagon), nei laptop (Intel AI Boost, AMD XDNA) e nei dispositivi IoT. Non sono progettate per l’addestramento — sono progettate per un’inferenza veloce e a basso consumo ai margini della rete.
Schema decisionale
| Caso d’uso | Chip migliore |
|---|---|
| Addestramento di grandi modelli AI | GPU |
| Inferenza su scala su Google Cloud | TPU |
| AI sul dispositivo a basso consumo | NPU |
| Carichi di lavoro misti, massima flessibilita | GPU |
Per la maggior parte dei team, la GPU rimane la scelta piu sicura e versatile. I TPU hanno senso all’interno dell’ecosistema Google Cloud, e le NPU sono essenziali per il deployment edge dove l’efficienza energetica e fondamentale.
Come accedere a una GPU: acquisto, noleggio o cloud
L’accesso alla potenza di calcolo GPU nel 2026 segue generalmente tre percorsi, ciascuno con compromessi distinti.
Acquisto dell’hardware
Una singola NVIDIA H100 costa $25.000-$40.000 al dettaglio — ammesso che si riesca a trovarne una, date le continue limitazioni nell’approvvigionamento. La costruzione di un server multi-GPU aggiunge costi per CPU, memoria, rete, alimentazione, raffreddamento e spazio rack. L’acquisto ha senso economico solo se si prevede di far funzionare le GPU ad alto utilizzo (superiore al 60%) 24 ore su 24 per anni. Per laboratori di ricerca e grandi aziende con carichi di lavoro prevedibili e costanti, la proprieta puo offrire il costo totale piu basso.
Principali fornitori cloud
AWS (istanze p5), Google Cloud (istanze A3) e Microsoft Azure (serie ND H100) offrono tutti istanze GPU con affidabilita enterprise, disponibilita globale e storage e rete integrati. Il compromesso e la complessita: i prezzi delle GPU cloud variano per regione, livello di impegno e tipo di istanza. Le istanze riservate richiedono impegni da 1 a 3 anni, mentre i prezzi on-demand possono essere da due a tre volte superiori alle tariffe spot.
Marketplace GPU
Una categoria crescente di piattaforme aggrega capacita GPU da data center distribuiti, offrendo modelli di accesso piu flessibili. GPUnex, ad esempio, aggrega capacita da oltre 150 data center e offre fatturazione al secondo con framework AI preinstallati (PyTorch, TensorFlow, JAX) — eliminando l’overhead di configurazione che spesso rallenta i team di ricerca. Questi marketplace sono particolarmente adatti per startup, ricercatori accademici e team con carichi di lavoro variabili che non giustificano impegni cloud riservati.
La domanda chiave
Se l’utilizzo medio della GPU e inferiore al 60%, il noleggio e quasi sempre piu conveniente rispetto alla proprieta. Si tenga traccia dell’utilizzo effettivo prima di impegnare capitale nell’hardware.
Il futuro delle GPU
La traiettoria delle GPU non mostra segni di rallentamento. Se mai, il ritmo del progresso sta accelerando.
L’architettura Rubin (2026) rappresenta un salto generazionale: 336 miliardi di transistor, 50 PFLOPS di inferenza FP4 e la prima integrazione di memoria HBM4 del settore. Si tratta approssimativamente di un miglioramento di 5 volte rispetto a Blackwell nel throughput di inferenza AI — una cadenza di miglioramento che supera di gran lunga la Legge di Moore.
La sfida energetica sta diventando urgente. Un singolo server GPU consuma 3.000-5.000 watt, rispetto ai 300-500 watt di un server CPU. Il consumo energetico globale dei data center dovrebbe raggiungere 96 GW entro il 2026 (Deloitte), e le GPU sono un fattore trainante primario. Il raffreddamento a liquido, i design di chip piu efficienti e i data center alimentati dall’energia nucleare sono tutti in fase di sviluppo attivo per affrontare questo problema.
I vincoli della catena di approvvigionamento continuano a plasmare il mercato. La memoria ad alta larghezza di banda (HBM) e esaurita fino al 2026, con SK Hynix, Samsung e Micron tutti operanti a massima capacita. Il packaging avanzato CoWoS di TSMC — la tecnologia che unisce i die GPU agli stack HBM — rimane il principale collo di bottiglia nella produzione.
Il computing neuromorfico rappresenta un cambiamento a piu lungo termine. Chip come Loihi di Intel e Akida di BrainChip imitano la struttura dei neuroni biologici e sono 1.000 volte piu efficienti dal punto di vista energetico rispetto alle GPU per determinati compiti di riconoscimento di pattern. Tuttavia, mancano dei framework di programmazione e degli ecosistemi software necessari per l’adozione mainstream e sono ancora distanti anni dal poter sfidare le GPU nei carichi di lavoro AI in produzione.
Le prospettive del mercato sono impressionanti. Da $101,5 miliardi nel 2025 a un previsto $1,7 trilioni entro il 2035 (Precedence Research), il mercato GPU sta crescendo a un tasso annuo composto del 32,6%. Le GPU non sono piu una categoria di componenti — stanno diventando l’infrastruttura che definisce l’era dell’AI, tanto fondamentale per l’economia degli anni 2020 quanto il microprocessore lo e stato per gli anni ‘90.
Domande frequenti
Cosa fa realmente una GPU?
Una GPU esegue migliaia di calcoli matematici simultaneamente. Originariamente progettata per il rendering della grafica — calcolando colore, luminosita e posizione di milioni di pixel per frame — le GPU oggi alimentano l’addestramento di modelli AI, simulazioni scientifiche, elaborazione video e qualsiasi carico di lavoro che benefici di un massiccio parallelismo. La capacita chiave e il throughput: una GPU sacrifica la velocita del singolo task per la capacita di elaborare enormi volumi di operazioni semplici contemporaneamente.
Serve una GPU per l’AI?
Per addestrare modelli con piu di qualche centinaio di milioni di parametri, si. Un’operazione che richiede ore a un cluster GPU potrebbe richiedere settimane o mesi a una CPU. Per l’inferenza su modelli piu piccoli (sotto 1,5 miliardi di parametri), le CPU moderne possono talvolta eguagliare le prestazioni delle GPU, specialmente con runtime ottimizzati come ONNX. Ma per uno sviluppo AI serio — il fine-tuning di modelli linguistici di grandi dimensioni, l’addestramento di modelli di diffusione, l’esecuzione di esperimenti di reinforcement learning — una GPU riduce drasticamente i tempi di iterazione ed e di fatto indispensabile.
Qual e la differenza tra VRAM e RAM?
La RAM (memoria di sistema) serve la CPU e il sistema operativo. Contiene le applicazioni in esecuzione, le cache dei file e i processi del sistema operativo. La VRAM (memoria video) e dedicata alla GPU e contiene texture, frame buffer, pesi del modello e risultati intermedi dei calcoli. La VRAM e tipicamente molto piu veloce — la HBM3 raggiunge 3,35 TB/s rispetto ai circa 50 GB/s della DDR5 — ma piu piccola in capacita totale. Per i carichi di lavoro AI, la VRAM e il collo di bottiglia critico: i pesi del modello, le attivazioni e gli stati dell’ottimizzatore devono tutti entrare nella VRAM per un addestramento efficiente.
Perche le GPU sono cosi costose?
Tre fattori convergenti determinano i prezzi delle GPU. Primo, la complessita della produzione: i nodi di fabbricazione piu avanzati di TSMC costano oltre $20 miliardi per stabilimento, e ogni wafer produce un numero limitato di die GPU grandi e complessi. Secondo, la scarsita di memoria ad alta larghezza di banda: l’offerta di HBM3 e HBM4 e esaurita fino al 2026, con la domanda delle aziende AI che supera di gran lunga la capacita produttiva. Terzo, una domanda senza precedenti: le aziende AI stanno spendendo complessivamente oltre $600 miliardi in infrastruttura nel 2026, creando un mercato favorevole ai venditori in cui NVIDIA puo imporre prezzi premium per le GPU da data center.
Si puo usare una GPU senza una CPU?
No. Una GPU e un acceleratore, non un processore autonomo. Ha bisogno di una CPU (l‘“host”) per coordinare le operazioni, gestire il sistema operativo, gestire l’I/O dei file ed eseguire la logica sequenziale. La CPU invia il lavoro alla GPU, che lo elabora in parallelo e restituisce i risultati. Funzionano come una squadra — la CPU orchestra mentre la GPU calcola. Anche in un enorme cluster GPU con 32.000 GPU, ogni nodo contiene CPU che gestiscono lo scheduling, la rete e il movimento dei dati.
Quanto costa noleggiare una GPU?
I prezzi delle GPU cloud variano ampiamente in base al modello di GPU, fornitore, regione e livello di impegno. Una NVIDIA H100 va da $1,49 a $6,98 all’ora a seconda del fornitore e del tipo di tariffa (spot, on-demand o riservata). Una A100 si trova a meno di $1/ora sui marketplace GPU. Per carichi di lavoro di inferenza leggera, una NVIDIA L4 parte da circa $0,30/ora. Le opzioni di fatturazione al secondo su alcune piattaforme possono ridurre ulteriormente i costi per lavori brevi e intermittenti.