GPUnex
Market & Trends 10 分钟阅读 ·

OpenAI与NVIDIA:合作关系、影响及对GPU租赁的意义

OpenAI-NVIDIA合作关系如何塑造GPU算力市场。训练到推理的转变、对GPU租赁费率的影响,以及大规模AI基础设施支出对GPU可用性的意义。

G

GPUnex 研究团队

GPU 与 AI 基础设施专家

Share

要点摘要

  • OpenAI是NVIDIA最大的单一客户之一,消耗数万块GPU来训练GPT-4及后续前沿模型
  • 训练到推理的转变意味着大约2/3的AI算力现在用于推理,将GPU需求从大型集群重塑为分布式容量
  • 2026年超过$6000亿的超大规模AI基础设施支出既造成了GPU短缺,也创造了新的租赁市场机会
  • H100的GPU租赁费率在2024年6月至2025年6月间下降了44%,受供应增加和市场竞争推动

OpenAI-NVIDIA动态关系

OpenAI与NVIDIA之间的关系是科技领域最具深远意义的合作之一。OpenAI——ChatGPT和GPT-4背后的公司——是NVIDIA 最大的单一GPU硬件消费者之一。训练前沿语言模型需要数万块GPU连续运行数月——而在AI的大部分历史中,这意味着在CUDA上运行的NVIDIA GPU。

但这一关系正在演变。据报道,OpenAI一直在开发定制的内部AI芯片以减少对NVIDIA的依赖。两家公司之间据报道的**$1000亿合作**交易据称已经流产。与此同时,NVIDIA面临来自AMD和定制芯片的日益激烈的竞争,而OpenAI则在为其不断增长的推理算力需求探索替代硬件。

理解这一动态很重要,因为AI最大消费者与其主要硬件供应商之间发生的事情会波及整个GPU算力市场——影响价格、可用性以及每个人的GPU租赁经济。

OpenAI如何使用NVIDIA GPU:规模与架构

OpenAI的算力需求规模令人震惊:

  • GPT-4训练据报道使用了10,000+块NVIDIA A100 GPU运行数月
  • GPT-5及后续模型预计需要更大的集群——可能50,000–100,000+块H100或B200 GPU
  • ChatGPT推理服务数亿用户,需要数千块GPU全天候运行以进行实时token生成
  • 总算力支出估计每年数十亿美元

这种规模的消费产生了几个市场效应。首先,它将NVIDIA相当大一部分的产出集中在单一客户手中。其次,它创造了一个参考架构——OpenAI使用什么就为行业设定了标准。第三,它创造了双方都在积极管理的依赖关系。

NVIDIA受益于OpenAI的大批量采购,但面临过度依赖单一客户的风险。OpenAI受益于NVIDIA的硬件,但面临定价权和供应分配的挑战。这种张力推动两家公司都走向多元化。

训练与推理的算力分配

AI算力中最重要的结构性转变是从以训练为主到以推理为主的工作负载转型。

Training vs Inference compute split: showing the shift from 67% training in 2023 to 67% inference in 2026 2023 Training: 67% Inference: 33% → 3 years 2026 Training: 33% Inference: 67% Source: Deloitte TMT Predictions 2026 What this means for GPU markets: Training: requires massive clusters (1,000+ GPUs) at hyperscaler facilities Inference: can run on distributed capacity across many smaller providers

根据Deloitte的TMT预测2026报告,推理现占所有AI算力的约三分之二,高于2023年的三分之一。这一逆转具有深远的影响:

训练是集中的。 训练前沿模型需要数千块GPU通过NVLink和InfiniBand在单一集群内高速通信。只有超大规模运营商和少数大型AI实验室拥有这种规模的集群。训练需求集中在市场顶端。

推理是分布式的。 向用户提供模型服务不需要大规模集群——它需要许多独立的GPU或小型GPU组独立处理请求。推理工作负载可以在分布式数据中心、不同的GPU型号上运行,以及通过从数百个提供商聚合容量的市场平台运行。

这一转变有利于更广泛的GPU租赁市场。随着推理增长,更多AI算力需求可以由分布式GPU容量来满足——这正是GPU市场平台所提供的。“AI算力”意味着”一个巨型集群”的时代正在让位于更分布式的模式。

对GPU租赁费率和可用性的影响

大规模AI支出与GPU供应增加之间的互动正在重塑租赁经济。

价格在下降

GPU租赁价格已大幅下降。H100云端定价在2024年6月至2025年6月间下降了44%,因为供应扩大、竞争加剧:

时间段H100典型费率变化
2024年中$4.00–$8.00/小时峰值定价
2024年末$3.00–$6.00/小时供应扩张中
2025年中$2.00–$4.00/小时市场竞争
2026年初$1.49–$3.90/小时当前市场

价格下降由三股力量驱动:NVIDIA增加H100产量、AMD增加竞争性容量(MI300X、MI355X),以及GPU市场聚合了此前闲置的分布式供应。

训练供应仍然紧张

尽管单个GPU实例价格下降,大型训练集群的批量分配仍然受限。寻求1,000+块H100进行持续训练的组织面临:

  • 专用集群6个月以上的交付时间
  • 保证长期分配的溢价定价
  • 来自优先考虑自有AI服务的超大规模运营商的竞争

这种双层市场——推理的充足竞价/市场供应、大规模训练的受限供应——反映了训练到推理的转变。推理GPU更容易配置,因为工作负载是分布式的。训练集群需要物理共置和高速互连,造成供应瓶颈。

HBM供应约束

高带宽内存(HBM)仍然是GPU生产中的关键瓶颈。HBM成本在2025年第4季度上涨超过30%,2026年初又上涨20%。SK Hynix、Samsung和Micron——三家HBM制造商——都在满负荷运转。预计最早到2027年末才能缓解。

这一内存瓶颈限制了总GPU产量,无论NVIDIA或AMD的芯片制造能力如何。即使有足够的GPU芯片,HBM的缺乏也限制了能组装多少完整的数据中心GPU。

更广泛的市场影响:谁受益、谁受困

OpenAI-NVIDIA动态关系以及更广泛的AI基础设施建设在GPU生态系统中创造了明确的赢家和输家。

受益者

GPU市场平台提供商。 推理转变意味着更多的算力需求可以由分布式GPU容量来满足。从众多提供商聚合供应的市场平台能够很好地捕获这一增长细分市场——通过竞争性供应动态提供低于超大规模运营商的价格。

拥有闲置GPU的硬件所有者。 随着推理需求增长和市场基础设施成熟,硬件所有者可以更有效地将闲置GPU容量变现。即使是消费级GPU(RTX 4090、RTX 5090)也可用于不需要数据中心级硬件的推理工作负载。如需了解如何出租你的GPU,请参阅我们的被动收入指南。

注重成本的AI团队。 不断下降的租赁价格和扩大的市场供应意味着初创公司、研究实验室和大学的AI团队可以用更少的钱获取更多算力。2024年$8/小时的H100现在只要$1.49–$3.15/小时——不到两年内成本降低了50–80%。

AMD。 推理转变发挥了AMD的优势。推理工作负载对CUDA和NVLink的依赖不如训练,削弱了NVIDIA的生态系统护城河。AMD有竞争力的定价和不断增长的ROCm支持使其成为推理导向型团队越来越可行的替代方案。如需详细对比,请参阅我们的NVIDIA vs AMD分析。

受困者

竞争训练集群的小型公司。 超大规模运营商和大型AI实验室吸收了大部分高端GPU分配。较小的公司面临更长的等待时间和更高的专用训练容量价格。

押注稳定定价的GPU所有者。 随着供应扩大,租赁费率正在下降。以2024年价格购买的硬件折旧速度快于历史常态,因为更便宜的租赁替代方案出现。

NVIDIA的定价权(边际性的)。 来自AMD、定制芯片(Google TPU、OpenAI和Meta的定制芯片)以及分布式市场的更多竞争对NVIDIA的溢价定价产生了渐进的下行压力。NVIDIA仍占主导地位,但其收取成本3–5倍溢价的能力正在受到考验。

GPU租赁者和提供者的实际建议

如果你租用GPU

为可预测的工作负载锁定当前费率。 租赁价格在下降,但随着需求追上可能会稳定。以今天的费率承诺预留容量可以防范未来的价格波动。

跨提供商分散。 不要依赖单一云提供商。使用GPU市场获取经济实惠的推理服务,当需要保证容量时使用超大规模运营商进行训练,专业云用于中间层工作负载。如需各提供商的详细定价,请参阅我们的云端GPU定价对比。

将推理和训练分开优化。 为不同任务使用不同的GPU型号。训练需要H100/B200级硬件。推理通常可以在A100、L40S甚至RTX 4090上有效运行,成本只是一小部分。请参阅我们的AI最佳GPU指南获取特定工作负载推荐。

如果你提供GPU

H100硬件在2026年保持价值。 尽管租赁费率下降,H100仍是训练和推理中最受欢迎的GPU。折旧将在2027年加速,因为Rubin架构GPU上市,但在2026年期间,H100提供者仍能产生强劲回报。

消费级GPU越来越适合出租。 推理转变意味着平台接受越来越多的消费级GPU(RTX 4090、RTX 5090)用于分布式推理工作负载。如果你有闲置的消费级硬件,出租的门槛比以往更低。

投资可靠性而非纯硬件规格。 平台越来越多地奖励正常运行时间、响应时间和一致性,而非纯粹的规格。一块持续可用的A100长期赚取的收入超过一块间歇性可用的H100。

常见问题

OpenAI只使用NVIDIA GPU吗?

主要是的——NVIDIA GPU驱动着OpenAI绝大多数的训练和推理基础设施。然而,OpenAI据报道正在开发定制AI芯片并探索替代硬件以减少NVIDIA依赖。定制芯片工作仍处于早期阶段,预计在2027–2028年之前不会显著减少NVIDIA依赖。

GPU租赁价格会继续下降吗?

价格已大幅下降(H100从2024年到2025年下降44%),可能会随着供应扩大和竞争加剧而继续缓慢下降。然而,下降速度正在放缓。需求继续以每年4–5倍的速度增长,最终将吸收扩大的供应。最可能的轨迹是旧型号GPU价格逐步降低,最新一代维持溢价定价。

训练到推理的转变对我意味着什么?

如果你是AI开发者:推理占所有AI算力的2/3意味着通过市场获得分布式、经济实惠的GPU访问的选择更多。你对大规模训练集群的依赖减少,更能利用推理工作负载的竞争性定价。如果你是GPU所有者:推理工作负载与消费级硬件和分布式设置更兼容,扩大了你硬件的潜在租户池。

OpenAI在GPU算力上花多少钱?

确切数字未公开,但估计OpenAI的年度算力支出达数十亿美元。仅GPT-4的训练据报道在算力上就花费超过$1亿。为数亿ChatGPT用户提供推理增加了显著的持续成本。Microsoft Azure——OpenAI的主要基础设施合作伙伴——已在该合作关系中投资超过$100亿。

我现在应该投资GPU硬件还是等待?

如果你现在需要算力,从市场租用以避免折旧风险。如果你考虑购买硬件用于租赁收入,H100在2026年期间仍是强劲投资,但在2027年Rubin架构GPU到来时将急剧折旧。如需硬件购买建议,请参阅我们的租赁vs购买分析了解详细的盈亏平衡计算。

Share

Ready to Get Started?

Earn daily revenue from GPU compute demand. Packages start at $59.