La chute de 1 000× : comment les coûts d’inférence se sont effondrés
Fin 2022, faire tourner un modèle de classe GPT-4 coûtait environ 20 $ par million de tokens. Début 2026, une performance équivalente coûte 0,40 $ par million de tokens — voire moins. C’est une réduction de 1 000× en un peu plus de trois ans, l’une des baisses de coûts les plus rapides de l’histoire de l’informatique.
Cet effondrement n’est pas dû à un facteur unique. Il résulte de la combinaison de quatre améliorations simultanées :
1. Gains d’efficacité matérielle. Chaque génération de GPU offre 2 à 3× plus de débit d’inférence par dollar. Le H100 traite environ 3× plus de tokens par seconde que l’A100 à un prix similaire. Blackwell pousse encore plus loin.
2. Optimisation logicielle et des compilateurs. Les frameworks d’inférence comme vLLM, TensorRT-LLM et SGLang ont amélioré l’utilisation des GPU de 30–40 % à 70–80 % grâce à des techniques comme le batching continu, PagedAttention et le décodage spéculatif.
3. Efficacité de l’architecture des modèles. Les modèles à mélange d’experts (MoE) comme Mixtral et DeepSeek V3 n’activent qu’une fraction du nombre total de paramètres par token, offrant une qualité de pointe à un coût de calcul 3 à 5× inférieur par token par rapport aux modèles denses équivalents.
4. Quantification et distillation. Faire tourner les modèles en précision INT8 ou INT4 réduit les besoins en mémoire et en calcul de 2 à 4× avec une perte de qualité minimale. Les modèles distillés plus petits reproduisent plus de 90 % des capacités des modèles plus grands à une fraction du coût.
L’effet combiné des améliorations matérielles, logicielles, d’architecture de modèles et de quantification est multiplicatif. Chaque gain de 2 à 3× se compose avec les autres, produisant la réduction globale de 1 000×.
Pourquoi l’inférence domine désormais la demande GPU
Pendant la majeure partie de l’ère du deep learning, l’entraînement consommait la majorité du calcul GPU. Entraîner un grand modèle nécessitait des milliers de GPU pendant des semaines ou des mois, tandis que l’inférence servait une base d’utilisateurs relativement restreinte.
Ce ratio s’est inversé. En 2026, l’inférence représente environ deux tiers de toute la demande de calcul AI, contre environ un tiers en 2023.
Trois forces expliquent ce basculement :
Adoption massive par le grand public. ChatGPT, Claude, Gemini et leurs concurrents servent désormais des centaines de millions d’utilisateurs. Chaque conversation, chaque complétion de code, chaque génération d’image est une charge de travail d’inférence. Un seul entraînement produit un modèle ; l’inférence sert ce modèle à des millions d’utilisateurs en continu.
Intégration de l’AI dans les flux de travail d’entreprise. Les entreprises sont passées de l’expérimentation avec l’AI à son intégration dans les applications de production — service client, génération de code, analyse de documents, recherche. Ces applications permanentes génèrent une demande d’inférence soutenue.
Agents et raisonnement multi-étapes. Les systèmes AI modernes utilisent de plus en plus le raisonnement multi-tours, l’utilisation d’outils et le traitement par chaîne de pensée, qui multiplient les tokens générés par interaction utilisateur par 5 à 50×. Un agent AI qui planifie, exécute et vérifie peut générer plus de 10 000 tokens par tâche contre 500 tokens pour une simple réponse question-réponse.
Point clé : Entraîner un modèle est un coût ponctuel. Le servir est un coût continu qui évolue avec le nombre d’utilisateurs. À mesure que l’AI devient un service — toujours actif, toujours disponible — la demande de calcul d’inférence croît sans limite. C’est le moteur fondamental de la demande GPU en 2026 et au-delà.
Coût par token : la métrique qui pilote les entreprises AI
Pour les entreprises AI, le coût par token a remplacé les FLOPS comme métrique déterminant la viabilité commerciale. Le calcul est direct : si votre coût d’inférence par million de tokens est de 1,00 $ et que vous facturez 2,00 $, votre marge brute est de 50 %. Si les coûts d’inférence tombent à 0,40 $ par million de tokens, le même tarif donne une marge de 80 % — ou vous pouvez baisser les prix pour augmenter le nombre d’utilisateurs.
Benchmarks actuels du coût par token (2026)
| Classe de modèle | Coût par million de tokens d’entrée | Coût par million de tokens de sortie | Cas d’usage typique |
|---|---|---|---|
| Frontier (GPT-4.5, Claude Opus) | 2,00–15,00 $ | 8,00–75,00 $ | Raisonnement complexe, recherche |
| Milieu de gamme (GPT-4o, Claude Sonnet) | 0,50–3,00 $ | 1,00–15,00 $ | Usage général, programmation |
| Efficient (GPT-4o-mini, Haiku) | 0,10–0,25 $ | 0,30–1,00 $ | Applications à haut volume |
| Open-source hébergé (Llama, Mixtral) | 0,05–0,30 $ | 0,10–0,60 $ | Sensible aux coûts, auto-hébergé |
| Distillé / Quantifié | 0,01–0,10 $ | 0,03–0,20 $ | Edge, traitement par lots |
Pourquoi le coût par token compte pour les opérateurs GPU
Si vous exploitez une infrastructure GPU — qu’il s’agisse d’un seul noeud ou d’un cluster multi-rack — les charges de travail d’inférence sont de plus en plus votre principale source de revenus. L’économie fonctionne différemment de l’entraînement :
Revenus d’entraînement : Gros contrats ponctuels. Un client loue 64 à 512 GPU pendant 2 à 8 semaines. Valeur totale élevée mais peu fréquent.
Revenus d’inférence : Plus faibles par requête mais continus. Les clients déploient des modèles et servent du trafic 24h/24, 7j/7. Plus prévisible, meilleure utilisation, plus adapté à la planification de capacité.
L’implication en termes de revenus : Les opérateurs GPU qui optimisent pour les charges de travail d’inférence — par le batching, l’infrastructure de service de modèles et la gestion des SLA — gagnent 20 à 40 % de revenus en plus par GPU-heure que ceux qui fournissent du calcul brut aux clients d’entraînement. Pour en savoir plus sur l’économie des opérateurs GPU, consultez notre guide sur l’économie des clusters.
Matériel pour l’inférence : pourquoi les H100 ne sont pas toujours la réponse
Le H100 domine l’entraînement AI car l’entraînement exige une bande passante mémoire maximale, une communication inter-GPU et un calcul FP16/BF16 intensif. L’inférence a des exigences différentes — et un matériel différent offre souvent de meilleures performances économiques.
Comparaison du matériel d’inférence
| GPU | Prix catalogue | Débit d’inférence (tokens/sec, Llama 70B) | Coût par million de tokens | Meilleur pour |
|---|---|---|---|---|
| H100 80GB SXM | 30 000 $ | ~2 800 | 0,30 $ | Grands modèles, inférence par lots |
| L40S 48GB | 7 500 $ | ~1 200 | 0,18 $ | Modèles moyens, charges mixtes |
| L4 24GB | 2 500 $ | ~400 | 0,17 $ | Modèles petits à moyens, haute densité |
| A100 80GB | 10 000 $ (occasion) | ~1 600 | 0,17 $ | Inférence économique à grande échelle |
| RTX 4090 24GB | 1 600 $ | ~350 | 0,13 $ | Inférence budget, petits modèles |
Le point clé : Pour les charges de travail d’inférence pures, le prix premium du H100 n’est souvent pas justifié. Un L40S offre un coût par token comparable à un quart du prix, ce qui en fait le meilleur choix pour les déploiements à forte inférence. Les avantages du H100 — NVLink, HBM3, débit FP16 massif — sont des caractéristiques d’entraînement que les charges d’inférence sous-utilisent.
Pour une comparaison détaillée des GPU NVIDIA capables d’inférence, consultez notre guide comparatif GPU. Pour les options de génération précédente offrant encore une bonne valeur en inférence, consultez notre analyse A100 vs A6000 vs A2000.
ASIC personnalisés : l’alternative exclusivement dédiée à l’inférence
Les TPU v5e de Google, les Trainium/Inferentia d’Amazon et les puces personnalisées émergentes sont conçus exclusivement pour l’inférence. Ces puces sacrifient la flexibilité d’entraînement pour une efficacité énergétique 3 à 5× meilleure sur les tâches d’inférence.
Le compromis : les ASIC personnalisés vous enferment dans l’écosystème et le format de modèle d’un fournisseur spécifique. Les GPU restent le choix universel car ils exécutent n’importe quel modèle de n’importe quel framework sans modification. Pour la plupart des participants aux marketplaces GPU, les GPU NVIDIA servant des charges d’inférence offrent le meilleur équilibre entre flexibilité et coût.
La chaîne d’approvisionnement de l’inférence : du cloud à la périphérie
Les charges de travail d’inférence couvrent une surface de déploiement plus large que l’entraînement. Alors que l’entraînement se fait dans des centres de données centralisés, l’inférence s’exécute partout où les utilisateurs en ont besoin.
Niveaux de déploiement
Niveau 1 : Cloud hyperscale (coût par token le plus bas à grande échelle) AWS, Azure, GCP et des fournisseurs spécialisés comme CoreWeave et Lambda proposent l’inférence via des API gérées et des instances GPU dédiées. Idéal pour les charges à haut volume tolérantes à la latence. Tarifs actuels : 1,50–6,98 $/h par H100.
Niveau 2 : Marketplaces GPU (optimisé en coût) Des plateformes comme Vast.ai, RunPod et d’autres marketplaces offrent l’hébergement d’inférence à un coût 40 à 60 % inférieur aux hyperscalers en agrégeant une offre GPU distribuée. Idéal pour les charges sensibles aux coûts où une certaine variabilité de latence est acceptable.
Niveau 3 : Sur site / co-localisé (coût prévisible) Les entreprises avec des charges d’inférence soutenues dépassant 50 000 GPU-heures/mois déploient de plus en plus du matériel acheté ou loué dans des installations de colocation. Coût initial le plus élevé mais coût par token le plus bas à grande échelle. Pour les options de financement, consultez notre guide de financement GPU.
Niveau 4 : Inférence en périphérie (optimisé en latence) Les GPU grand public (RTX 4090), les puces mobiles et les appareils edge dédiés servent l’inférence localement pour les applications critiques en latence (véhicules autonomes, traduction en temps réel, assistants embarqués). Les petits modèles et la quantification agressive rendent cela viable.
| Niveau | Coût par token | Latence | Échelle | Cas d’usage exemple |
|---|---|---|---|---|
| Cloud hyperscale | Moyen | 50–200 ms | Illimitée | LLM servis par API |
| Marketplace GPU | Bas | 80–300 ms | Élastique | Inférence par lots, API de fine-tuning |
| Sur site | Le plus bas (à l’échelle) | 10–50 ms | Fixe | Applications AI d’entreprise |
| Périphérie | Le plus élevé par token | 5–20 ms | Par appareil | Temps réel, sensible à la confidentialité |
Point clé : Le « bon » déploiement d’inférence dépend des exigences de latence, pas seulement du coût. Une AI d’imagerie médicale nécessitant un temps de réponse de 10 ms ne peut pas utiliser une API cloud distante quel que soit le prix. La chaîne d’approvisionnement de l’inférence se stratifie par niveau de latence, créant une demande GPU distincte pour chacun.
Ce que la baisse des coûts d’inférence signifie pour les marchés GPU
La réduction de 1 000× du coût d’inférence n’est pas seulement une étape technique — elle remodèle l’économie de tout l’écosystème GPU.
Effet de demande : une inférence moins chère crée plus de demande
C’est le paradoxe de Jevons appliqué au calcul AI. À mesure que l’inférence devient moins chère, les organisations déploient l’AI dans des charges de travail auparavant prohibitives en termes de coûts. Le résultat : les dépenses totales en inférence augmentent même si les coûts unitaires baissent.
Considérez : à 20 $ par million de tokens, seules les applications d’entreprise à plus forte valeur justifiaient le déploiement d’un LLM. À 0,40 $ par million de tokens, chaque produit SaaS, chaque outil interne et chaque application grand public peut intégrer l’AI. Le marché adressable s’élargit de plusieurs ordres de grandeur.
Implications pour le marché GPU
1. La demande d’inférence soutient les prix des GPU. Même si les coûts par token baissent, le volume des charges d’inférence croît plus vite. Le total de GPU-heures consommées pour l’inférence augmente, soutenant les tarifs de location sur les marketplaces GPU.
2. Les GPU plus anciens trouvent une seconde vie. L’A100, à l’origine un cheval de bataille pour l’entraînement, est désormais une carte d’inférence économique. Les GPU qui ne peuvent plus rivaliser pour les revenus d’entraînement descendent la « cascade de valeur » pour servir des charges d’inférence de manière rentable. Cela prolonge la durée de vie économique utile du matériel GPU. Pour en savoir plus sur cette dynamique, consultez notre analyse des GPU comme classe d’actifs.
3. L’offre optimisée pour l’inférence se développe. La gamme de produits NVIDIA s’est orientée vers des SKU capables d’inférence (L4, L40S, H200 avec plus de mémoire). Le signal du marché est clair : l’inférence est là où se dirige la demande en volume.
4. Les dynamiques de marketplace évoluent. Les marketplaces GPU servent de plus en plus des clients d’inférence aux côtés des clients d’entraînement. Les charges d’inférence tendent à être plus petites par client mais plus nombreuses et plus persistantes — changeant le profil d’utilisation de sporadique à régulier.
La taille du marché de l’inférence
| Année | Marché estimé du calcul d’inférence | Croissance annuelle | Part du calcul AI total |
|---|---|---|---|
| 2023 | ~12 milliards $ | — | ~33 % |
| 2024 | ~25 milliards $ | +108 % | ~50 % |
| 2025 | ~38 milliards $ | +52 % | ~58 % |
| 2026 (projeté) | ~55 milliards $ | +45 % | ~67 % |
Le marché de l’inférence devrait dépasser 50 milliards de dollars en 2026, croissant plus vite que l’entraînement pour la première fois. Cela représente un changement structurel dans la nature de la demande GPU — passant de clusters d’entraînement massifs et ponctuels à une infrastructure d’inférence permanente et distribuée mondialement.
Projections : la route vers 0,01 $ par million de tokens
Si la trajectoire actuelle se maintient, l’inférence équivalente à GPT-4 coûtera moins de 0,01 $ par million de tokens d’ici 2028. À ce niveau de prix, l’inférence AI devient effectivement gratuite pour la plupart des applications — moins chère que les requêtes de base de données, moins chère que la bande passante CDN, moins chère que la journalisation.
Ce qui continue de réduire les coûts
Matériel de nouvelle génération. Les architectures NVIDIA Blackwell et Rubin offrent un débit d’inférence 2 à 4× supérieur à Hopper. Les AMD MI350 et Intel Gaudi 3 ajoutent une pression concurrentielle. Chaque génération de matériel réinitialise la courbe des coûts.
Décodage spéculatif et mise en cache. Les techniques qui prédisent les séquences de tokens probables et mettent en cache les calculs intermédiaires peuvent réduire le calcul effectif par token de 2 à 5× pour les charges prévisibles ou répétitives.
Distillation de modèles à grande échelle. À mesure que les modèles frontier deviennent des implémentations de référence, les versions distillées plus petites capturent la plupart des capacités à un coût d’inférence 10 à 100× inférieur. Le modèle « suffisamment bon » pour la plupart des tâches continue de rétrécir.
Puces spécifiques à l’inférence. Les puces d’inférence spécialisées (Groq LPU, Google TPU, Amazon Inferentia) optimisent le débit de tokens plutôt que la flexibilité d’entraînement. À mesure qu’elles mûrissent, elles pousseront les opérateurs GPU à rivaliser sur le coût par token.
Ce que cela signifie pour les investisseurs et opérateurs GPU
Court terme (2026–2027) : La croissance de la demande d’inférence dépasse la réduction des coûts. Les revenus totaux d’inférence continuent de croître. Les opérateurs GPU bénéficient d’une demande soutenue, en particulier pour les cartes de milieu de gamme (A100, L40S) qui offrent d’excellentes performances économiques en inférence.
Moyen terme (2027–2029) : Le coût par token approche des niveaux de commodité. La différenciation passe du matériel au logiciel (frameworks de service, garanties SLA, positionnement géographique). Les opérateurs de marketplaces GPU qui construisent des avantages logiciels autour du service d’inférence capteront une valeur disproportionnée.
Long terme (2029+) : L’inférence devient un service public, tarifé comme la bande passante ou le stockage. Le marché GPU se bifurque : le matériel d’entraînement continue de commander des primes pour le développement de modèles frontier, tandis que le matériel d’inférence devient un commerce de volume avec des marges fines mais une échelle massive.
Pour les startups AI qui planifient leurs budgets de calcul, comprendre cette trajectoire des coûts d’inférence est crucial — consultez notre guide des coûts de calcul pour startups pour des conseils de budget par étape.
Questions fréquemment posées
Pourquoi les coûts d’inférence ont-ils chuté aussi vite ?
Quatre facteurs se composent : les améliorations matérielles (2 à 3× par génération), l’optimisation logicielle (batching continu, PagedAttention — 2 à 3×), l’efficacité de l’architecture des modèles (modèles MoE — 3 à 5×), et la quantification (2 à 4×). Chaque amélioration se multiplie avec les autres, produisant la réduction totale d’environ 1 000× sur 3 ans.
L’entraînement ou l’inférence est-il plus important pour la demande GPU ?
L’inférence domine désormais. Entraîner un modèle frontier est un événement ponctuel nécessitant des milliers de GPU pendant des semaines. Servir ce modèle nécessite des GPU fonctionnant 24h/24, 7j/7 pendant des années. Avec des centaines de millions d’utilisateurs AI générant des tokens en continu, l’inférence représente environ 67 % du calcul AI total en 2026.
Quel est le meilleur GPU pour l’inférence ?
Cela dépend de la taille du modèle. Pour les grands modèles (70B+ paramètres), le H100 et l’A100 fournissent la mémoire et la bande passante nécessaires. Pour les modèles moyens (7B–30B), le L40S offre le meilleur coût par token. Pour les petits modèles, le L4 ou même la RTX 4090 peut servir l’inférence à très faible coût. Pour une comparaison complète, consultez notre guide du meilleur GPU pour l’AI.
Comment la baisse des coûts d’inférence affecte-t-elle les tarifs de location GPU ?
De manière contre-intuitive, la baisse des coûts par token n’a pas réduit les tarifs de location GPU. Le paradoxe de Jevons s’applique : une inférence moins chère ouvre de nouveaux cas d’usage, augmentant la demande totale. Les tarifs des marketplaces GPU pour les H100 sont restés stables ou ont augmenté même si le coût par token a baissé, car davantage de clients louent des GPU pour des charges d’inférence.
Les ASIC personnalisés remplaceront-ils les GPU pour l’inférence ?
Partiellement. Les puces personnalisées comme les TPU de Google, Inferentia d’Amazon et le LPU de Groq offrent une efficacité d’inférence supérieure pour des architectures de modèles spécifiques. Cependant, les GPU conservent des avantages en flexibilité (exécuter n’importe quel modèle), maturité de l’écosystème et disponibilité. Le résultat probable est la coexistence : les ASIC pour l’inférence à haut volume et standardisée ; les GPU pour tout le reste. Pour en savoir plus sur le côté entraînement de cette équation de coûts, consultez notre analyse des coûts d’entraînement AI.