头条数字:前沿模型的实际成本
训练前沿AI模型是人类历史上最昂贵的工程项目之一。以下是真实数据:
| 模型 | 年份 | 估算训练成本 | GPU硬件 | 训练持续时间 |
|---|---|---|---|---|
| GPT-3(1750亿) | 2020 | ~460万美元 | ~1,000个V100 GPU | ~34天 |
| PaLM(5400亿) | 2022 | ~1200万美元 | 6,144个TPU v4芯片 | ~50天 |
| GPT-4(~1.8T MoE) | 2023 | ~7900万美元 | 10,000+个A100 GPU | ~100天 |
| Gemini Ultra | 2024 | ~1.91亿美元 | 16,384个TPU v5芯片 | ~130天 |
| Llama 3.1 405B | 2024 | ~6000万美元 | 16,384个H100 GPU | ~54天 |
| DeepSeek R1 | 2025 | ~29.4万美元 | ~2,000个H800 GPU | ~55天 |
DeepSeek R1的数字引人注目。当前沿实验室花费数亿美元时,DeepSeek通过激进的效率优化以不到30万美元实现了具有竞争力的性能——证明成本并非纯粹是模型质量的函数。
训练成本分解:算力、数据和工程
训练成本不仅仅是GPU租赁。以下是资金的实际去向:
GPU算力(65%)是主导成本。对于7900万美元的训练运行,大约5100万美元用于GPU租赁或摊销的硬件成本。这是最受供应商选择和硬件效率影响的成本组成部分。
**数据准备(15%)**包括网络爬取、过滤、去重、分词和RLHF的人工标注。高质量数据越来越昂贵——合成数据和自动化流程正在降低但并未消除成本。
**工程(12%)**涵盖设计、运行和调试训练的ML研究人员、基础设施工程师和支持人员。顶级AI研究人员年薪超过100万美元。前沿训练运行需要一个20-50+名工程师的团队工作数月。
**基础设施(8%)**包括存储(PB级训练数据)、高速网络(节点间400 GbE)、编排软件和监控。在初始预算中经常被低估。
成本悖论:为什么支出在增长而单位成本在崩溃
这是反直觉的现实:总训练成本呈指数增长,而每单位算力成本呈指数下降。
- 总支出每年增长2.4倍——实验室训练更大的模型,使用更多数据
- 每FLOP成本大约每年下降10倍——更好的硬件,更好的算法
- 训练成本占收入的百分比在增加——即使万亿美元公司也感受到压力
这个悖论存在是因为实验室扩展的速度超过了效率提升所能抵消的速度。每一代新模型比上一代大5-10倍,而效率提升每代减少2-3倍的每FLOP成本。净效果:尽管算力更便宜,支出仍在增加。
这对GPU需求意味着什么: 即使单个GPU变得更强大和高效,前沿训练所需的GPU总数持续增长。这维持了GPU基础设施提供商的需求——和定价权。
按模型大小分类的训练成本:从70亿到1T+参数
不是每个人都在训练前沿模型。以下是不同规模的训练成本:
| 模型大小 | 典型训练算力 | 估算成本(H100市场平台) | 估算成本(AWS) |
|---|---|---|---|
| 10亿参数 | ~1,000 GPU小时 | ~$1,500–$2,500 | ~$4,000–$7,000 |
| 70亿参数 | ~10,000 GPU小时 | ~$15,000–$25,000 | ~$40,000–$70,000 |
| 130亿参数 | ~25,000 GPU小时 | ~$37,500–$62,500 | ~$100,000–$175,000 |
| 700亿参数 | ~200,000 GPU小时 | ~$300,000–$500,000 | ~$800,000–$1.4M |
| 4050亿参数 | ~1,500,000 GPU小时 | ~$2.2M–$3.7M | ~$6M–$10.5M |
| 1T+(前沿) | ~10,000,000+ GPU小时 | ~$15M–$25M | ~$40M–$70M |
注:这些是粗略估算。实际成本因训练效率、数据质量、超参数调优失败和硬件利用率的不同而差异显著。
市场平台和超大规模云定价之间2-3倍的成本差异在各种规模上是一致的。对于训练70亿模型的初创公司,这是$15K和$40K的区别——有意义但可控。对于训练1T+模型的前沿实验室,差距是数千万美元。
供应商选择如何影响训练预算
在哪里租GPU是AI中最具杠杆效应的成本决策之一:
| 供应商类型 | H100月成本(24/7) | 12个月成本 | 与AWS相比的节省 |
|---|---|---|---|
| AWS(按需) | ~$2,800 | ~$33,600 | — |
| 专业云(Lambda) | ~$2,150 | ~$25,800 | 23% |
| 市场平台(已验证主机) | ~$1,150 | ~$13,800 | 59% |
| 预留/承诺 | ~$1,700 | ~$20,400 | 39% |
对于1,000 GPU小时的训练运行,AWS按需和市场平台之间的差异约为**$2,000**。将此扩展到100,000 GPU小时的运行,差异为**$200,000**。在前沿规模,供应商选择影响数百万的预算。
关于所有主要供应商的详细定价对比,请参阅我们的云GPU定价指南。关于选择哪款GPU型号,请参阅我们的最佳AI GPU指南。
关键洞察: 许多团队默认使用现有云提供商(AWS、GCP、Azure)进行训练,因为很方便。这种便利可能比市场平台替代方案贵40-60%。对于超过$10,000的训练运行,花30分钟注册市场平台账户所带来的回报是数百倍。
效率突破:以更少成本训练更好的模型
DeepSeek R1的例子(29.4万美元实现有竞争力的性能)说明原始支出不是唯一路径。2026年的关键效率技术:
混合专家模型(MoE): 每次输入只激活模型参数的子集,将每次前向传播的算力减少4-8倍。GPT-4据报道使用MoE——一个约1.8T参数的模型,每个token只激活约2800亿参数。这极大减少了每个有效参数的训练FLOP需求。
量化感知训练: 从一开始就以较低精度(BF16、FP8)训练,将内存和算力需求减少2-4倍,质量影响最小。NVIDIA Blackwell GPU原生支持FP4训练。
数据质量重于数量: OpenAI的研究表明,在更小、更高质量的数据集上训练可以匹配在10倍以上低质量数据上训练的模型。在数据策展上的投资减少了算力需求。
架构创新: Ring Attention(用于长上下文)、FlashAttention(用于内存效率)和推测性解码(用于更快推理)等技术将效率提升复合化。每一代技术都减少了给定质量水平所需的算力。
蒸馏: 训练一个较小的”学生”模型来模仿较大的”教师”模型,可以以10-100倍更低的训练和推理成本达到教师80-95%的性能。
预测:训练成本的走向(2026-2028)
上限持续上升。 Anthropic的Dario Amodei表示,到2028年前沿模型的训练成本可能达到100亿美元。是否有单个模型真的会花这么多取决于效率提升和边际收益递减的经济学。
下限持续下降。 同时,训练”GPT-4等效”模型的成本持续下降——从2023年的7900万美元到2026年使用当前一代硬件和效率技术的估计500-1000万美元。两年前属于前沿昂贵的东西,对资金充裕的初创公司来说正变得可及。
对GPU需求的影响: 两种趋势都维持着GPU需求。前沿实验室需要更多GPU用于更大的模型。较小的组织需要GPU来训练最近还不可能的东西。训练算力的总潜在市场在两个方向上都在扩展。
关于推理成本如何遵循类似但更陡峭的下降趋势,请参阅我们的推理经济学分析。关于初创公司特定的预算指导,请参阅我们的AI初创公司算力指南。
常见问题
微调模型需要多少钱?
微调比预训练便宜得多。在GPU市场平台上微调一个70亿模型大约需要**$50-$500**(几百GPU小时)。微调一个700亿模型需要**$500-$5,000**。LoRA和QLoRA技术可以进一步将成本降低5-10倍。微调对于几乎任何拥有几百美元的团队来说都是可及的。
为什么GPT-4训练如此昂贵?
规模。GPT-4据报道使用13万亿token在10,000+个A100 GPU上训练了大约100天。按A100市场平台费率(~$1.00/小时),10,000个GPU运行2,400小时仅算力就是2400万美元——而实际成本更高,因为有训练重启、超参数调优和基础设施开销。
我能以不到$1,000训练一个有用的AI模型吗?
可以。在领域特定数据上微调现有开源模型(Llama 3、Mistral)可以用**$50-$500完成。从头训练小模型(10-30亿参数)需要$1,000-$5,000**。关键是利用预训练模型和LoRA等高效技术,而不是从头训练。
训练成本如何影响AI市场?
高训练成本创造了进入壁垒——只有资金充裕的组织才能训练前沿模型。这将权力集中在少数实验室(OpenAI、Anthropic、Google、Meta)。然而,开源模型(Llama、Mistral、DeepSeek)和下降的微调成本正在民主化对强大AI的访问。训练成本壁垒对前沿模型很高,但对应用AI来说很低。
训练成本会持续上升吗?
前沿训练的总支出可能会继续上升(向$10亿+),因为实验室追求更大、更强大的模型。但实现任何给定性能水平的成本正在快速下降——2023年花费7900万美元的东西到2026年将低于1000万美元。两个陈述同时为真。
如何估算我项目的训练成本?
经验法则:一个有N十亿参数的模型在T个token上训练大约需要**(6 × N × T) FLOPs**。除以GPU的FLOP/s速率得到GPU小时数。乘以小时费率。例如:一个70亿模型在1T token上训练需要42 × 10^18 FLOPs。H100提供990 TFLOPS(BF16)。大约是11,800 GPU小时,或按$1.50/小时市场平台费率约**$17,700**。再加30-50%用于开销(重启、调优、评估)。