La réponse rapide : quel GPU choisir ?
Il n’existe pas de « meilleur GPU pour l’AI » unique. Le bon choix dépend de trois facteurs : ce que vous faites (entraînement, fine-tuning ou inférence), la taille de votre modèle (1B paramètres ou 70B+), et combien vous souhaitez dépenser (par heure et au total).
Si vous voulez une réponse en une ligne : pour l’entraînement à grande échelle, le H100 ou B200. Pour le fine-tuning économique, la RTX 4090 ou l’A100. Pour l’inférence de production, la L40S ou la L4. Mais le vrai sujet est dans les chiffres — spécifiquement, la métrique que la plupart des guides GPU ignorent : le coût par TFLOP.
Ce guide se concentre sur cette métrique. Plutôt que de répéter des tableaux de spécifications brutes disponibles dans notre guide complet des GPU, nous analysons quel GPU vous donne le plus de performances AI par dollar pour votre charge de travail spécifique.
Coût par TFLOP : la métrique qui compte vraiment
Les TFLOPS bruts (milliers de milliards d’opérations en virgule flottante par seconde) indiquent la vitesse de calcul d’un GPU. Mais la vitesse ne veut rien dire sans contexte. Un H200 délivre ~1 000 FP16 TFLOPS, mais il coûte 3,80 $/h. Une RTX 4090 délivre ~330 FP16 TFLOPS à 0,60 $/h. Lequel est réellement la meilleure affaire ?
Le coût par TFLOP répond à cela : divisez le prix de location horaire dans le cloud par la note FP16 TFLOPS. Plus bas est meilleur.
Les résultats sont contre-intuitifs. La RTX 4090 — une carte grand public de gaming — offre le meilleur coût par TFLOP de toute la gamme. Le B200 — le nouveau vaisseau amiral NVIDIA pour centres de données — arrive en second. Le populaire H100 se situe au milieu du classement, et la L40S est la moins efficace par TFLOP.
Mais le coût par TFLOP ne raconte pas toute l’histoire. La RTX 4090 n’a que 24 Go de VRAM GDDR6X, ce qui la limite aux modèles qui tiennent dans cette mémoire. Le B200 a 192 Go de HBM3e, qui peut contenir des modèles 8× plus grands. L’efficacité brute doit être mise en balance avec les capacités.
| GPU | VRAM | FP16 TFLOPS | Cloud $/h | Coût/TFLOP/h | Prix d’achat | TDP |
|---|---|---|---|---|---|---|
| B200 | 192 Go HBM3e | ~2 500 | ~4,70 $ | 0,0019 $ | 45–50K $ | 1 000 W |
| H200 | 141 Go HBM3e | ~1 000 | ~3,80 $ | 0,0038 $ | 30–40K $ | 700 W |
| H100 | 80 Go HBM3 | ~1 000 | ~3,15 $ | 0,0032 $ | ~25K $ | 700 W |
| A100 80GB | 80 Go HBM2e | ~312 | ~0,72 $ | 0,0023 $ | ~15K $ (occasion) | 300 W |
| L40S | 48 Go GDDR6X | ~366 | ~1,50 $ | 0,0041 $ | ~8K $ | 350 W |
| RTX 4090 | 24 Go GDDR6X | ~330 | ~0,60 $ | 0,0018 $ | ~1 600 $ | 450 W |
Point clé : Le GPU le plus cher à l’heure n’est pas toujours le plus cher par unité de travail. Le coût par TFLOP révèle que la RTX 4090 et le B200 sont les leaders en efficacité — aux extrémités opposées du spectre de capacités.
Recommandations par charge de travail : associer le GPU à la tâche
Le bon GPU n’est pas le plus rapide ou le moins cher — c’est celui qui correspond à votre charge de travail. Voici un cadre de décision pratique.
Fine-tuning de modèles petits à moyens (7B–13B paramètres)
Meilleur choix : RTX 4090 (0,60 $/h) ou A100 40GB
Le fine-tuning d’un modèle de 7B paramètres avec LoRA ou QLoRA nécessite environ 14 à 20 Go de VRAM — largement dans les 24 Go de la RTX 4090. À 0,60 $/h sur les marketplaces GPU, une session de fine-tuning de 10 heures coûte seulement 6 $. Le même travail sur un H100 à 3,15 $/h coûte 31,50 $ — plus de 5× plus pour une charge qui n’a pas besoin de la VRAM ou bande passante supplémentaire du H100.
Pour le fine-tuning complet (sans LoRA) de modèles 13B, l’A100 40GB à ~0,72 $/h fournit suffisamment de VRAM à une fraction du prix du H100.
Pré-entraînement de grands modèles (70B+ paramètres)
Meilleur choix : H100 ou B200 en clusters multi-GPU
Le pré-entraînement d’un modèle de 70B+ paramètres nécessite 140+ Go de VRAM pour le modèle seul, plus les activations, les gradients et les états de l’optimiseur. Aucun GPU individuel sauf le B200 (192 Go) ne peut contenir cela en mémoire. En pratique, ces charges tournent sur des clusters multi-GPU utilisant le parallélisme de modèle et le parallélisme de données sur 8 à 128+ GPU.
L’interconnexion NVLink 4.0 du H100 (900 Go/s bidirectionnel) permet une communication multi-GPU efficace — critique pour l’entraînement distribué où les GPU doivent partager les gradients à chaque passe forward/backward. Le B200 pousse encore plus loin avec une bande passante plus élevée et plus de mémoire, mais la disponibilité reste limitée jusqu’en 2027.
À grande échelle, le coût total est vertigineux. L’entraînement de GPT-4 aurait utilisé 10 000+ GPU A100 fonctionnant pendant des mois. Même aux tarifs marketplace, un cluster de 1 000 H100 fonctionnant pendant 30 jours coûte environ 2,3 millions de dollars.
Inférence de production (traitement par lots)
Meilleur choix : L40S (1,50 $/h) pour l’efficacité coût
L’inférence par lots — traiter de nombreuses requêtes simultanément — bénéficie des 48 Go de VRAM GDDR6X et des bonnes performances FP16 de la L40S. Bien que son coût par TFLOP soit plus élevé que la RTX 4090, sa capacité VRAM double lui permet de servir des modèles plus grands et des tailles de lots plus importantes, améliorant le débit par dollar.
Pour les charges d’inférence où le modèle tient dans 24 Go (la plupart des modèles 7B après quantification), la RTX 4090 reste l’option la plus rentable.
Inférence de production (faible latence)
Meilleur choix : H200 pour la vitesse, L4 pour l’edge
Quand la latence d’une requête unique compte plus que le débit (chatbots, API en temps réel), la bande passante mémoire de 4 800 Go/s du H200 offre la génération de tokens la plus rapide. La L4 (0,30–1,00 $/h) sert d’option budget pour l’inférence légère en périphérie — 24 Go de VRAM à une fraction du coût.
Consommation électrique et coûts opérationnels
Le choix d’un GPU ne se résume pas au calcul et aux tarifs cloud. Si vous possédez du matériel (ou l’envisagez), les coûts d’électricité se cumulent significativement au fil du temps.
| GPU | TDP (Watts) | Coût électrique annuel* | $/h effectif (possession sur 3 ans) |
|---|---|---|---|
| B200 | 1 000 W | ~526 $/an | ~1,80 $ |
| H100 / H200 | 700 W | ~368 $/an | ~1,05 $ |
| RTX 4090 | 450 W | ~237 $/an | ~0,25 $ |
| L40S | 350 W | ~184 $/an | ~0,40 $ |
| A100 | 300 W | ~158 $/an | ~0,55 $ |
Suppose une utilisation moyenne de 60 % et un tarif électrique de 0,10 $/kWh.
Le TDP de 1 000 W du B200 en fait le GPU le plus énergivore de la gamme — consommant plus de 500 $/an en électricité seule à utilisation modérée. Pour les propriétaires de matériel dans les régions avec des coûts d’électricité élevés (au-dessus de 0,25 $/kWh, courant dans une grande partie de l’Europe), cela impacte significativement la rentabilité de posséder des GPU versus les louer dans le cloud.
Analyse du seuil de rentabilité : acheter vs. louer
La décision d’acheter ou louer des GPU se résume à l’utilisation et à l’horizon temporel. Voici le calcul pour le H100 — le point de décision le plus courant :
- Prix d’achat du H100 : ~25 000 $
- Tarif de location marketplace : ~3,15 $/h
- Heures de seuil de rentabilité : 25 000 / 3,15 = ~7 937 heures
- En fonctionnement 24h/24 : ~11 mois pour atteindre le seuil de rentabilité
- À 60 % d’utilisation : ~18 mois pour atteindre le seuil de rentabilité
Ajoutez l’électricité (0,07 $/h), les frais de refroidissement (0,02 $/h) et la maintenance, et le coût effectif de possession sur 3 ans est d’environ 1,05 $/h — compétitif avec les tarifs marketplace mais uniquement à utilisation soutenue élevée.
La variable critique est l’utilisation. Si vos GPU sont inactifs 50 % du temps, vous payez le double du tarif effectif. La location cloud élimine entièrement les coûts d’inactivité — vous ne payez que lorsque le calcul tourne.
Pour un cadre complet d’achat vs. location incluant le refroidissement, les installations, le personnel et l’amortissement, consultez notre comparaison détaillée des coûts.
Perspectives 2026 : Blackwell, Rubin et ce qui arrive
Le paysage GPU évolue rapidement. Voici ce qui compte pour planifier votre infrastructure AI :
NVIDIA B200 (architecture Blackwell) — Déjà livré en quantités limitées, le B200 offre environ 4× les performances d’entraînement du H100 avec 192 Go de HBM3e et un TDP de 1 000 W. C’est le meilleur choix pour les nouveaux clusters d’entraînement à grande échelle mais reste contraint en approvisionnement jusqu’en 2027. La disponibilité cloud s’élargit chez les hyperscalers et fournisseurs spécialisés.
Architecture NVIDIA Rubin — Annoncée pour fin 2026, Rubin embarque 336 milliards de transistors et cible 50 PFLOPS d’inférence FP4. Si livré dans les temps, cela représente un bond d’environ 5× par rapport à Blackwell pour le débit d’inférence. Cela changera dramatiquement l’équation du coût par TFLOP — mais les délais d’approvisionnement signifient que la plupart des équipes n’accéderont au matériel Rubin qu’en 2027.
AMD MI350X et MI355X — La réponse d’AMD à Blackwell. Le MI355X a démontré une inférence 30 % plus rapide que le B200 sur Llama 3.1 405B, avec des tarifs compétitifs. L’écosystème ROCm croissant d’AMD réduit la dépendance à CUDA pour les charges d’inférence. Pour une comparaison détaillée, consultez notre analyse NVIDIA vs. AMD.
L’implication pratique : N’achetez pas de matériel aujourd’hui en espérant qu’il restera haut de gamme pendant 3+ ans. Les générations de GPU se renouvellent tous les 18 à 24 mois, et chaque génération offre 2 à 4× les performances de la précédente. Pour la plupart des équipes, la location vous donne accès au matériel le plus récent sans risque de dépréciation.
Comment choisir : la check-list de décision
Avant de sélectionner un GPU, répondez à ces cinq questions :
-
Quelle est votre charge de travail ? Entraînement, fine-tuning ou inférence ? Chacun a des besoins différents en calcul, mémoire et bande passante.
-
Quelle est la taille de votre modèle ? Les modèles de moins de 13B paramètres peuvent tourner sur des GPU de 24 Go. Les modèles de plus de 70B nécessitent des configurations multi-GPU avec 80+ Go par GPU.
-
Quel est votre budget horaire ? Sous 1 $/h, vos options sont RTX 4090, A100 en spot ou L4. Au-dessus de 3 $/h, vous pouvez accéder au H100 ou B200.
-
Combien d’heures par mois utiliserez-vous ? Moins de 100 heures → louez toujours. 100 à 500 heures → louez sur les marketplaces. Plus de 500 heures à haute utilisation → envisagez la possession.
-
Combien de temps aurez-vous besoin de ce matériel ? Moins de 18 mois → louez (évite la dépréciation). 18+ mois à haute utilisation → l’achat peut atteindre le seuil de rentabilité. Pour une comparaison approfondie entre architectures GPU, y compris comment les CPU et GPU se complètent, consultez notre guide GPU vs. CPU.
Point clé : Le « meilleur » GPU est le moins cher qui peut exécuter votre charge de travail spécifique. Une RTX 4090 faisant du fine-tuning sur un modèle 7B est un meilleur investissement qu’un H100 faisant le même travail — vous obtenez le même résultat à 1/5 du coût.
Questions fréquemment posées
Quel est le meilleur GPU pour entraîner de grands modèles de langage ?
Pour les modèles de plus de 70B paramètres, le NVIDIA H100 reste la référence — il offre 80 Go de HBM3, NVLink 4.0 pour le scaling multi-GPU et l’écosystème logiciel le plus mature. Le B200 est l’étape supérieure avec 192 Go de HBM3e et environ 4× les performances d’entraînement, mais la disponibilité est limitée. Pour les modèles plus petits (7B–13B), la RTX 4090 ou l’A100 offrent d’excellentes performances à une fraction du coût. Pour une comparaison détaillée des options de génération Ampere de NVIDIA, consultez notre comparatif A100 vs A6000 vs A2000.
La RTX 4090 est-elle adaptée à l’AI ?
Oui — c’est l’un des GPU les plus rentables pour le fine-tuning AI et l’inférence de modèles petits à moyens. Ses 24 Go de VRAM gèrent des modèles jusqu’à ~13B paramètres (avec quantification), et son coût par TFLOP est le meilleur du secteur. La limitation est la VRAM : pour les modèles qui dépassent 24 Go, vous avez besoin d’un GPU data center avec plus de mémoire. Elle manque aussi de NVLink, ce qui rend le scaling multi-GPU moins efficace que les cartes data center.
Devrais-je acheter ou louer un GPU pour l’AI ?
Louez si votre utilisation est inférieure à 60 % ou si votre horizon est de moins de 18 mois. Le marché GPU évolue vite — une nouvelle architecture tous les 2 ans signifie que le matériel acheté se déprécie rapidement. Louer sur les marketplaces GPU vous donne accès au matériel le plus récent à 0,60–3,15 $/h sans investissement en capital. N’achetez que si vous avez des charges soutenues et prévisibles fonctionnant 500+ heures/mois pendant 2+ ans.
Qu’est-ce que le coût par TFLOP et pourquoi est-ce important ?
Le coût par TFLOP divise le tarif horaire de location d’un GPU par sa performance en virgule flottante en TFLOPS. Il normalise les performances entre les modèles de GPU, révélant quelle carte vous donne le plus de calcul AI par dollar. Un GPU avec un tarif horaire bas mais de faibles performances peut en réalité coûter plus cher par unité de travail qu’un GPU plus cher et plus performant. C’est la métrique unique la plus proche du « rapport qualité-prix » en calcul GPU.
De combien de VRAM ai-je besoin pour l’AI ?
Règle empirique : un modèle de N milliards de paramètres nécessite environ 2×N Go de VRAM pour l’inférence en FP16, et 4×N Go pour l’entraînement (à cause des gradients et des états de l’optimiseur). Un modèle 7B a besoin de ~14 Go pour l’inférence, ~28 Go pour le fine-tuning complet. La quantification (INT8, INT4) peut réduire les besoins en VRAM de 2 à 4×. Utilisez la RTX 4090 (24 Go) pour les modèles jusqu’à ~13B quantifiés, l’A100/L40S (48–80 Go) pour les modèles jusqu’à ~40B, et le H100/H200/B200 (80–192 Go) pour les modèles 70B+.