簡潔な回答:どのGPUを選ぶべきか?
「AIに最適なGPU」は一つだけではありません。正しい選択は3つの要素に依存します:何をするか(トレーニング、ファインチューニング、推論)、モデルの大きさ(1Bパラメータか70B以上か)、そして予算(時間単価と合計)。
一行で答えるなら:大規模トレーニングにはH100またはB200。コスト効率の高いファインチューニングにはRTX 4090またはA100。本番推論にはL40SまたはL4。しかし本当の答えは数字にあります — 特に、ほとんどのGPUガイドが無視している指標:コスト・パー・TFLOP。
このガイドではその指標に焦点を当てます。GPU完全ガイドで入手可能な生のスペック表を繰り返すのではなく、特定のワークロードに対してどのGPUが1ドルあたり最もAIパフォーマンスを提供するかを分析します。
コスト・パー・TFLOP:本当に重要な指標
生のTFLOPS(1秒間に実行される浮動小数点演算の兆数)はGPUの計算速度を示します。しかし速度だけでは文脈がありません。H200は約1,000 FP16 TFLOPSを提供しますが、コストは$3.80/hrです。RTX 4090は約330 FP16 TFLOPSを$0.60/hrで提供します。実際にどちらがお得でしょうか?
コスト・パー・TFLOPがその答えです:時間あたりのクラウドレンタル価格をFP16 TFLOPS評価で割ります。低いほど良いです。
結果は直感に反しています。RTX 4090 — コンシューマー向けゲーミングカード — がラインアップ全体で最良のコスト・パー・TFLOPを提供しています。B200 — NVIDIAの最新データセンターフラッグシップ — が2位。人気のH100は中間に位置し、L40SはTFLOPあたり最も効率が悪くなっています。
しかしコスト・パー・TFLOPがすべてではありません。RTX 4090は24 GBのGDDR6X VRAMしかなく、そのメモリに収まるモデルに制限されます。B200は192 GBのHBM3eを搭載し、8倍大きなモデルを保持できます。生の効率性は能力とバランスを取る必要があります。
| GPU | VRAM | FP16 TFLOPS | クラウド $/hr | コスト/TFLOP/hr | 購入価格 | TDP |
|---|---|---|---|---|---|---|
| B200 | 192 GB HBM3e | ~2,500 | ~$4.70 | $0.0019 | $45–50K | 1,000W |
| H200 | 141 GB HBM3e | ~1,000 | ~$3.80 | $0.0038 | $30–40K | 700W |
| H100 | 80 GB HBM3 | ~1,000 | ~$3.15 | $0.0032 | ~$25K | 700W |
| A100 80GB | 80 GB HBM2e | ~312 | ~$0.72 | $0.0023 | ~$15K(中古) | 300W |
| L40S | 48 GB GDDR6X | ~366 | ~$1.50 | $0.0041 | ~$8K | 350W |
| RTX 4090 | 24 GB GDDR6X | ~330 | ~$0.60 | $0.0018 | ~$1,600 | 450W |
重要な洞察: 時間あたり最も高価なGPUが、必ずしも作業単位あたり最も高価とは限りません。コスト・パー・TFLOPは、RTX 4090とB200が効率のリーダーであることを明らかにしています — 能力スペクトラムの正反対の端に位置しながら。
ワークロード推奨:GPUをタスクに合わせる
最適なGPUは最速でも最安でもありません — ワークロードに合致するものです。実用的な判断フレームワークをご紹介します。
小〜中規模モデルのファインチューニング(7B〜13Bパラメータ)
最適な選択:RTX 4090($0.60/hr)またはA100 40GB
LoRAまたはQLoRAで7Bパラメータモデルをファインチューニングするには、約14〜20 GBのVRAMが必要です — RTX 4090の24 GBの範囲内です。GPUマーケットプレイスで$0.60/hrなら、10時間のファインチューニングの費用はわずか**$6です。同じジョブをH100で$3.15/hrで実行すると$31.50** — H100の追加VRAMや帯域幅を必要としないワークロードに5倍以上のコストがかかります。
13Bモデルの完全ファインチューニング(LoRAなし)には、A100 40GBが約$0.72/hrで十分なVRAMをH100の数分の一の価格で提供します。
大規模モデルのプリトレーニング(70B以上のパラメータ)
最適な選択:マルチGPUクラスタのH100またはB200
70B以上のパラメータモデルのプリトレーニングには、モデルだけで140 GB以上のVRAMが必要で、さらにアクティベーション、勾配、オプティマイザの状態も必要です。B200(192 GB)を除き、単一のGPUではこれをメモリに保持できません。実際には、これらのワークロードはマルチGPUクラスタでモデル並列処理とデータ並列処理を使用して8〜128以上のGPUで実行されます。
H100のNVLink 4.0インターコネクト(双方向900 GB/s)は、効率的なマルチGPU通信を可能にします — これは分散トレーニングにおいてGPUが前向き/後ろ向きパスごとに勾配を共有する必要がある場合に重要です。B200はより高い帯域幅とより大きなメモリでこれをさらに推進しますが、2027年まで供給は制約されています。
スケールでは、総コストは驚異的です。GPT-4のトレーニングには10,000以上のA100 GPUが数ヶ月間使用されたと報告されています。マーケットプレイス価格でも、1,000 GPUのH100クラスタを30日間稼働させると約230万ドルのコストがかかります。
本番推論(バッチ処理)
最適な選択:コスト効率のためのL40S($1.50/hr)
バッチ推論 — 多数のリクエストを同時に処理 — は、L40Sの48 GB GDDR6X VRAMと強力なFP16パフォーマンスの恩恵を受けます。コスト・パー・TFLOPはRTX 4090より高いですが、2倍のVRAM容量でより大きなモデルとバッチサイズに対応でき、1ドルあたりのスループットが向上します。
モデルが24 GBに収まる推論ワークロード(量子化後のほとんどの7Bモデル)では、RTX 4090が依然として最もコスト効率の高い選択肢です。
本番推論(低レイテンシ)
最適な選択:速度ならH200、エッジならL4
単一リクエストのレイテンシがスループットよりも重要な場合(チャットボット、リアルタイムAPI)、H200の4,800 GB/sのメモリ帯域幅が最速のトークン生成を提供します。L4($0.30〜$1.00/hr)は、エッジでの軽量推論のための予算オプションとして機能します — コストの数分の一で24 GBのVRAMを提供します。
消費電力と運用コスト
GPU選択はコンピュートとクラウド価格だけではありません。ハードウェアを所有している(または検討している)場合、電気代は時間とともに大きく積み重なります。
| GPU | TDP(ワット) | 年間電気代* | 実効 $/hr(3年間の所有) |
|---|---|---|---|
| B200 | 1,000W | ~$526/年 | ~$1.80 |
| H100 / H200 | 700W | ~$368/年 | ~$1.05 |
| RTX 4090 | 450W | ~$237/年 | ~$0.25 |
| L40S | 350W | ~$184/年 | ~$0.40 |
| A100 | 300W | ~$158/年 | ~$0.55 |
平均稼働率60%、電気料金$0.10/kWhを想定。
B200の1,000W TDPはラインアップの中で最も電力を消費するGPUです — 中程度の稼働率でも年間500ドル以上の電気代がかかります。電気料金が高い地域($0.25/kWh以上、ヨーロッパの多くの地域で一般的)のハードウェアオーナーにとって、これはGPU所有対クラウドレンタルの経済性に大きな影響を与えます。
損益分岐分析:購入 vs レンタル
GPUを購入するかレンタルするかの判断は、稼働率と期間に帰着します。H100の計算を示します — 最も一般的な判断ポイント:
- H100購入価格: ~$25,000
- マーケットプレイスレンタル料金: ~$3.15/hr
- 損益分岐時間: 25,000 ÷ 3.15 = ~7,937時間
- 24時間365日稼働の場合: 損益分岐まで約11ヶ月
- 60%稼働率の場合: 損益分岐まで約18ヶ月
電気代($0.07/hr)、冷却オーバーヘッド($0.02/hr)、メンテナンスを加えると、3年間の実効所有コストは約**$1.05/hr**となります — マーケットプレイス価格と競争力がありますが、持続的な高稼働率の場合のみです。
重要な変数は稼働率です。GPUが50%の時間アイドル状態であれば、実効料金は2倍になります。クラウドレンタルはアイドルコストを完全に排除します — コンピュートが稼働しているときだけ支払います。
冷却、施設、人員、減価償却を含む完全なレンタル対購入フレームワークについては、詳細なコスト比較をご覧ください。
2026年の展望:Blackwell、Rubin、そして次に来るもの
GPUの状況は急速に変化しています。AIインフラストラクチャの計画に重要なことは以下の通りです:
NVIDIA B200(Blackwellアーキテクチャ) — 限定数量ですでに出荷中のB200は、192 GBのHBM3eと1,000W TDPでH100の約4倍のトレーニングパフォーマンスを提供します。新しい大規模トレーニングクラスタに最適な選択ですが、2027年まで供給は制約されています。ハイパースケーラーや専門プロバイダーでのクラウド提供が拡大中です。
NVIDIA Rubinアーキテクチャ — 2026年後半に発表予定のRubinは3,360億トランジスタを搭載し、FP4推論で50 PFLOPSを目標としています。スケジュール通りに出荷されれば、推論スループットでBlackwellの約5倍の飛躍を意味します。これによりコスト・パー・TFLOPの計算は劇的に変わりますが、調達リードタイムにより2027年までほとんどのチームはRubinハードウェアにアクセスできません。
AMD MI350XとMI355X — Blackwellに対するAMDの回答。MI355XはLlama 3.1 405BでB200より30%高速な推論を実証し、競争力のある価格設定です。AMDの成長するROCmエコシステムは推論ワークロードのCUDA依存を減らしています。詳細な比較については、NVIDIA対AMD分析をご覧ください。
実用的な含意: 3年以上トップティアであり続けることを期待してハードウェアを購入しないでください。GPUの世代は18〜24ヶ月ごとに交代し、各世代は前世代の2〜4倍のパフォーマンスを提供します。ほとんどのチームにとって、レンタルは減価償却リスクなしで最新ハードウェアにアクセスする方法です。
選び方:判断チェックリスト
GPUを選択する前に、以下の5つの質問に答えてください:
-
ワークロードは何ですか? トレーニング、ファインチューニング、推論のいずれですか?それぞれコンピュート、メモリ、帯域幅の要件が異なります。
-
モデルの大きさは? 13Bパラメータ未満のモデルは24 GB GPUで実行できます。70B以上のモデルにはGPUあたり80 GB以上のマルチGPUセットアップが必要です。
-
時間あたりの予算は? $1/hr未満なら、選択肢はRTX 4090、スポットのA100、またはL4です。$3+/hrなら、H100またはB200にアクセスできます。
-
月に何時間使用しますか? 100時間未満 → 常にレンタル。100〜500時間 → マーケットプレイスからレンタル。高稼働率で500時間以上 → 所有を検討。
-
このハードウェアをどのくらいの期間必要としますか? 18ヶ月未満 → レンタル(減価償却を回避)。高稼働率で18ヶ月以上 → 購入が損益分岐する可能性あり。GPUアーキテクチャのより深い比較(CPUとGPUがどのように補完し合うかを含む)については、GPU対CPUガイドをご覧ください。
重要な洞察: 「最高の」GPUは、特定のワークロードを実行できる最も安価なGPUです。7BモデルをファインチューニングするためのRTX 4090は、同じジョブをこなすH100よりも良い投資です — 1/5のコストで同じ結果が得られます。
よくある質問
大規模言語モデルのトレーニングに最適なGPUは?
70Bパラメータ以上のモデルには、NVIDIA H100が依然として標準です — 80 GBのHBM3、マルチGPUスケーリング用のNVLink 4.0、最も成熟したソフトウェアエコシステムを提供します。B200は192 GB HBM3eと約4倍のトレーニングパフォーマンスで次のステップアップですが、供給は限られています。小さなモデル(7B〜13B)には、RTX 4090またはA100がコストの数分の一で優れたパフォーマンスを提供します。NVIDIAのAmpere世代オプションの詳細比較については、A100 vs A6000 vs A2000の比較をご覧ください。
RTX 4090はAIに適していますか?
はい — 小〜中規模モデルのAIファインチューニングと推論に最もコスト効率の高いGPUの一つです。24 GBのVRAMは最大約13Bパラメータのモデル(量子化あり)を処理でき、コスト・パー・TFLOPは業界最高です。制限はVRAMです:24 GBを超えるモデルには、より多くのメモリを搭載したデータセンターGPUが必要です。またNVLinkがないため、マルチGPUスケーリングはデータセンターカードより効率が落ちます。
AIのためにGPUを購入すべきかレンタルすべきか?
稼働率が60%未満、または期間が18ヶ月未満ならレンタル。GPUマーケットは急速に動きます — 2年ごとに新アーキテクチャが登場し、購入したハードウェアは急速に減価償却します。GPUマーケットプレイスからのレンタルは$0.60〜$3.15/hrで資本投資なしに最新ハードウェアにアクセスできます。購入は、2年以上にわたり月500時間以上の持続的で予測可能なワークロードがある場合のみ。
コスト・パー・TFLOPとは何か、なぜ重要か?
コスト・パー・TFLOPは、GPUの時間あたりレンタル費用をTFLOPSでの浮動小数点パフォーマンスで割ったものです。GPUモデル間のパフォーマンスを正規化し、どのカードが1ドルあたり最もAIコンピュートを提供するかを明らかにします。時間あたりの料金は低いがパフォーマンスも低いGPUは、より高価で高パフォーマンスなGPUよりも作業単位あたりのコストが高い可能性があります。GPUコンピューティングにおける「コストパフォーマンス」に最も近い単一指標です。
AIにはどれくらいのVRAMが必要か?
大まかな目安として:N十億パラメータのモデルはFP16での推論に約2×N GBのVRAM、トレーニング(勾配とオプティマイザの状態のため)に4×N GBが必要です。7Bモデルは推論に約14 GB、完全ファインチューニングに約28 GBが必要です。量子化(INT8、INT4)でVRAM要件を2〜4倍削減できます。量子化された最大約13BモデルにはRTX 4090(24 GB)、最大約40BモデルにはA100/L40S(48〜80 GB)、70B以上のモデルにはH100/H200/B200(80〜192 GB)を使用してください。