Падение в 1000 раз: как обрушились затраты на инференс
В конце 2022 года работа модели класса GPT-4 стоила примерно $20 за миллион токенов. В начале 2026 года эквивалентная производительность стоит $0,40 за миллион токенов — или меньше. Это снижение в 1000 раз всего за чуть более три года — одно из самых быстрых снижений затрат в истории вычислений.
Этот обвал был обусловлен не одним фактором. Он стал результатом совокупного эффекта четырёх одновременных улучшений:
1. Рост эффективности оборудования. Каждое поколение GPU обеспечивает в 2–3 раза большую пропускную способность инференса на доллар. H100 обрабатывает примерно в 3 раза больше токенов в секунду, чем A100 при аналогичной ценовой категории. Blackwell продвигает это ещё дальше.
2. Оптимизация ПО и компиляторов. Фреймворки инференса, такие как vLLM, TensorRT-LLM и SGLang, улучшили утилизацию GPU с 30–40% до 70–80% благодаря таким техникам, как непрерывное пакетирование, PagedAttention и спекулятивное декодирование.
3. Эффективность архитектуры моделей. Модели Mixture-of-Experts (MoE), такие как Mixtral и DeepSeek V3, активируют лишь часть общего количества параметров на токен, обеспечивая результаты передового качества при в 3–5 раз более низких затратах на вычисления по сравнению с эквивалентными плотными моделями.
4. Квантизация и дистилляция. Запуск моделей с точностью INT8 или INT4 снижает требования к памяти и вычислениям в 2–4 раза с минимальной потерей качества. Меньшие дистиллированные модели воспроизводят 90%+ возможностей более крупных моделей при малой доле затрат.
Совокупный эффект улучшений в оборудовании, ПО, архитектуре моделей и квантизации является мультипликативным. Каждое улучшение в 2–3 раза умножается на остальные, давая суммарное снижение в ~1000 раз.
Почему инференс теперь доминирует в спросе на GPU
На протяжении большей части эры глубокого обучения AI обучение потребляло основную часть GPU-вычислений. Обучение крупной модели требовало тысяч GPU на недели или месяцы, тогда как инференс обслуживал сравнительно небольшую базу пользователей.
Это соотношение инвертировалось. В 2026 году инференс составляет примерно две трети всего спроса на AI-вычисления, по сравнению с примерно одной третью в 2023 году.
Три силы движут этим сдвигом:
Массовое потребительское внедрение. ChatGPT, Claude, Gemini и их конкуренты теперь обслуживают сотни миллионов пользователей. Каждый разговор, каждое автодополнение кода, каждая генерация изображения — это нагрузка инференса. Один запуск обучения даёт одну модель; инференс обслуживает эту модель миллионам пользователей непрерывно.
AI-интеграция в корпоративные рабочие процессы. Компании перешли от экспериментов с AI к встраиванию его в продакшн-приложения — обслуживание клиентов, генерация кода, анализ документов, поиск. Эти постоянно работающие приложения генерируют устойчивый спрос на инференс.
Агенты и многошаговые рассуждения. Современные AI-системы всё активнее используют многоходовые рассуждения, вызов инструментов и обработку цепочки мыслей, которые умножают количество токенов на взаимодействие с пользователем в 5–50 раз. AI-агент, который планирует, выполняет и проверяет, может генерировать 10 000+ токенов на задачу против 500 токенов для простого ответа на вопрос.
Ключевой вывод: Обучение модели — это разовая затрата. Обслуживание — непрерывная затрата, масштабирующаяся с ростом пользователей. По мере того как AI становится утилитой — всегда включённой, всегда доступной — спрос на вычисления инференса растёт без ограничений. Это фундаментальный драйвер спроса на GPU в 2026 году и далее.
Стоимость за токен: метрика, управляющая AI-компаниями
Для AI-компаний стоимость за токен заменила FLOPS как метрику, определяющую жизнеспособность бизнеса. Математика проста: если стоимость инференса за миллион токенов составляет $1,00, а вы берёте $2,00, ваша валовая маржа — 50%. Если затраты на инференс падают до $0,40 за миллион токенов, то же ценообразование даёт 80% маржи — или вы можете снизить цены для роста пользователей.
Текущие бенчмарки стоимости за токен (2026)
| Класс модели | Стоимость за миллион входных токенов | Стоимость за миллион выходных токенов | Типичный сценарий использования |
|---|---|---|---|
| Передовые (GPT-4.5, Claude Opus) | $2,00–$15,00 | $8,00–$75,00 | Сложные рассуждения, исследования |
| Средний уровень (GPT-4o, Claude Sonnet) | $0,50–$3,00 | $1,00–$15,00 | Универсальные задачи, кодирование |
| Эффективные (GPT-4o-mini, Haiku) | $0,10–$0,25 | $0,30–$1,00 | Приложения с высоким объёмом |
| Open-source (Llama, Mixtral) | $0,05–$0,30 | $0,10–$0,60 | Экономные, self-hosted |
| Дистиллированные / квантизированные | $0,01–$0,10 | $0,03–$0,20 | Edge, пакетная обработка |
Почему стоимость за токен важна для GPU-операторов
Если вы управляете GPU-инфраструктурой — будь то один узел или многостоечный кластер — нагрузки инференса всё больше становятся вашим основным источником дохода. Экономика работает иначе, чем при обучении:
Доход от обучения: Крупные, нерегулярные контракты. Клиент арендует 64–512 GPU на 2–8 недель. Высокая общая стоимость, но нечастые заказы.
Доход от инференса: Меньший за запрос, но непрерывный. Клиенты развёртывают модели и обслуживают трафик 24/7. Более предсказуемый, более высокая утилизация, лучше для планирования мощностей.
Влияние на доход: GPU-операторы, оптимизирующие инференс-нагрузки — через пакетирование, инфраструктуру обслуживания моделей и управление SLA — зарабатывают на 20–40% больше дохода за GPU-час, чем те, кто предоставляет сырые вычисления для обучения. Подробнее об экономике GPU-операторов читайте в нашем руководстве по экономике кластеров.
Оборудование для инференса: почему H100 не всегда лучший ответ
H100 доминирует в обучении AI, потому что обучение требует максимальной пропускной способности памяти, межGPU-коммуникации и вычислений FP16/BF16. Инференс имеет другие требования — и другое оборудование часто обеспечивает лучшую экономику.
Сравнение оборудования для инференса
| GPU | MSRP | Пропускная способность инференса (токенов/сек, Llama 70B) | Стоимость за 1M токенов | Лучше всего для |
|---|---|---|---|---|
| H100 80GB SXM | $30 000 | ~2 800 | $0,30 | Крупные модели, пакетный инференс |
| L40S 48GB | $7 500 | ~1 200 | $0,18 | Средние модели, смешанные нагрузки |
| L4 24GB | $2 500 | ~400 | $0,17 | Малые-средние модели, высокая плотность |
| A100 80GB | $10 000 (б/у) | ~1 600 | $0,17 | Экономичный инференс в масштабе |
| RTX 4090 24GB | $1 600 | ~350 | $0,13 | Бюджетный инференс, малые модели |
Ключевой вывод: Для чистых нагрузок инференса премиальная цена H100 часто не оправдана. L40S обеспечивает сопоставимую стоимость за токен при четверти цены, что делает его лучшим выбором для развёртываний с преобладанием инференса. Преимущества H100 — NVLink, HBM3, массивная пропускная способность FP16 — это функции для обучения, которые нагрузки инференса недоиспользуют.
Подробное сравнение GPU NVIDIA для инференса смотрите в нашем руководстве по сравнению GPU. О вариантах предыдущих поколений с хорошей инференс-экономикой читайте в нашем анализе A100 vs A6000 vs A2000.
Специализированные ASIC: альтернатива только для инференса
TPU v5e от Google, Trainium/Inferentia от Amazon и появляющийся специализированный кремний разработаны исключительно для инференса. Эти чипы жертвуют гибкостью обучения ради в 3–5 раз лучшей энергоэффективности на задачах инференса.
Компромисс: специализированные ASIC привязывают вас к экосистеме и формату моделей конкретного провайдера. GPU остаются универсальным выбором, поскольку запускают любую модель из любого фреймворка без модификаций. Для большинства участников GPU-маркетплейсов GPU NVIDIA для инференса обеспечивают лучший баланс гибкости и стоимости.
Цепочка поставок инференса: от облака до edge
Нагрузки инференса охватывают более широкую поверхность развёртывания, чем обучение. Пока обучение происходит в централизованных дата-центрах, инференс работает везде, где он нужен пользователям.
Уровни развёртывания
Уровень 1: Гиперскейл-облако (самая низкая стоимость за токен в масштабе) AWS, Azure, GCP и специализированные провайдеры вроде CoreWeave и Lambda обслуживают инференс через управляемые API и выделенные GPU-инстансы. Лучше всего для высокообъёмных нагрузок, допускающих задержки. Текущие тарифы: $1,50–$6,98/час за H100.
Уровень 2: GPU-маркетплейсы (оптимизация затрат) Платформы вроде Vast.ai, RunPod и другие маркетплейсы предлагают хостинг инференса по на 40–60% более низким ценам, чем гиперскейлеры, агрегируя распределённое GPU-предложение. Лучше для бюджетных нагрузок, где допустима некоторая вариативность задержки.
Уровень 3: On-premise / колокейшн (предсказуемая стоимость) Компании с устойчивыми нагрузками инференса свыше 50 000 GPU-часов/месяц всё чаще развёртывают собственное или арендованное оборудование в колокейшн-объектах. Наивысшие начальные затраты, но самая низкая стоимость за токен в масштабе. Варианты финансирования описаны в нашем руководстве по финансированию GPU.
Уровень 4: Edge-инференс (оптимизация задержки) Потребительские GPU (RTX 4090), мобильные чипы и выделенные edge-устройства обслуживают инференс локально для приложений, критичных к задержкам (автономные транспортные средства, перевод в реальном времени, ассистенты на устройстве). Малые модели и агрессивная квантизация делают это возможным.
| Уровень | Стоимость за токен | Задержка | Масштаб | Пример использования |
|---|---|---|---|---|
| Гиперскейл-облако | Средняя | 50–200 мс | Неограниченный | LLM через API |
| GPU-маркетплейс | Низкая | 80–300 мс | Эластичный | Пакетный инференс, API для дообучения |
| On-premise | Самая низкая (в масштабе) | 10–50 мс | Фиксированный | Корпоративные AI-приложения |
| Edge | Самая высокая за токен | 5–20 мс | На устройство | Реальное время, конфиденциальность |
Ключевой вывод: «Правильное» развёртывание инференса зависит от требований к задержке, а не только от стоимости. AI для медицинской визуализации, требующий 10 мс времени отклика, не может использовать удалённый облачный API вне зависимости от цены. Цепочка поставок инференса стратифицируется по уровням задержки, создавая отдельный спрос на GPU для каждого из них.
Что снижение стоимости инференса означает для рынков GPU
Снижение стоимости инференса в 1000 раз — не просто техническая веха, а перестройка экономики всей GPU-экосистемы.
Эффект спроса: дешёвый инференс создаёт больше спроса
Это парадокс Джевонса в применении к AI-вычислениям. По мере удешевления инференса организации развёртывают AI в нагрузках, которые ранее были экономически нецелесообразны. Результат: общие расходы на инференс растут, даже когда единичная стоимость падает.
Рассмотрим: при $20 за миллион токенов только самые ценные корпоративные приложения оправдывали развёртывание LLM. При $0,40 за миллион токенов каждый SaaS-продукт, внутренний инструмент и потребительское приложение может встроить AI. Адресуемый рынок расширяется на порядки.
Последствия для рынка GPU
1. Спрос на инференс поддерживает цены на GPU. Даже при падении стоимости за токен объём инференс-нагрузок растёт быстрее. Суммарные GPU-часы для инференса увеличиваются, поддерживая арендные ставки на GPU-маркетплейсах.
2. Старые GPU обретают вторую жизнь. A100, изначально рабочая лошадка обучения, теперь является экономичной инференс-картой. GPU, которые не могут конкурировать в обучении, спускаются по «каскаду ценности» для прибыльного обслуживания инференс-нагрузок. Это продлевает полезный экономический срок службы GPU. Подробнее об этой динамике в нашем анализе GPU как класса активов.
3. Предложение оборудования для инференса растёт. Линейка продуктов NVIDIA сместилась к SKU для инференса (L4, L40S, H200 с увеличенной памятью). Сигнал рынка ясен: инференс — туда направляется объёмный спрос.
4. Динамика маркетплейсов меняется. GPU-маркетплейсы всё чаще обслуживают клиентов инференса наряду с клиентами обучения. Инференс-нагрузки обычно меньше на клиента, но более многочисленные и устойчивые — меняя профиль утилизации с пиковой на стабильную.
Размер рынка инференса
| Год | Оценочный рынок инференс-вычислений | Рост г/г | Доля в общих AI-вычислениях |
|---|---|---|---|
| 2023 | ~$12 млрд | — | ~33% |
| 2024 | ~$25 млрд | +108% | ~50% |
| 2025 | ~$38 млрд | +52% | ~58% |
| 2026 (прогноз) | ~$55 млрд | +45% | ~67% |
Рынок инференса, по прогнозам, превысит $55 миллиардов в 2026 году, впервые обогнав по темпам роста рынок обучения. Это структурный сдвиг в том, как выглядит спрос на GPU — от нечастых массивных обучающих кластеров к постоянно работающей, глобально распределённой инференс-инфраструктуре.
Прогнозы: путь к $0,01 за миллион токенов
Если текущая траектория сохранится, инференс уровня GPT-4 будет стоить менее $0,01 за миллион токенов к 2028 году. При такой цене AI-инференс становится практически бесплатным для большинства приложений — дешевле запросов к базе данных, дешевле CDN-пропускной способности, дешевле логирования.
Что движет дальнейшим снижением затрат
Оборудование нового поколения. Архитектуры NVIDIA Blackwell и Rubin обеспечивают в 2–4 раза большую пропускную способность инференса по сравнению с Hopper. AMD MI350 и Intel Gaudi 3 усиливают конкурентное давление. Каждое поколение оборудования обновляет кривую затрат.
Спекулятивное декодирование и кэширование. Техники, предсказывающие вероятные последовательности токенов и кэширующие промежуточные вычисления, могут снизить эффективные вычисления на токен в 2–5 раз для повторяющихся или предсказуемых нагрузок.
Дистилляция моделей в масштабе. По мере того как передовые модели становятся эталонными реализациями, меньшие дистиллированные версии захватывают большую часть возможностей при в 10–100 раз более низкой стоимости инференса. «Достаточно хорошая» модель для большинства задач продолжает уменьшаться.
Специализированный кремний для инференса. Чипы, созданные специально для инференса (Groq LPU, Google TPU, Amazon Inferentia), оптимизируют пропускную способность токенов в ущерб гибкости обучения. По мере их зрелости они будут вынуждать GPU-операторов конкурировать по стоимости за токен.
Что это означает для GPU-инвесторов и операторов
Краткосрочная перспектива (2026–2027): Рост спроса на инференс опережает снижение затрат. Общий доход от инференса продолжает расти. GPU-операторы выигрывают от устойчивого спроса, особенно на карты среднего уровня (A100, L40S), обеспечивающие отличную инференс-экономику.
Среднесрочная перспектива (2027–2029): Стоимость за токен приближается к товарному уровню. Дифференциация смещается от оборудования к ПО (фреймворки обслуживания, гарантии SLA, географическое размещение). GPU-маркетплейс-операторы, создающие программные «рвы» вокруг обслуживания инференса, захватят непропорциональную долю ценности.
Долгосрочная перспектива (2029+): Инференс становится утилитой, ценообразуемой как пропускная способность или хранилище. Рынок GPU раздваивается: оборудование для обучения продолжает стоить премиально для разработки передовых моделей, тогда как оборудование для инференса становится объёмным товарным бизнесом с тонкой маржой, но массивным масштабом.
Для AI-стартапов, планирующих бюджеты на вычисления, понимание траектории стоимости инференса критически важно — смотрите наше руководство по затратам стартапов на вычисления для поэтапных рекомендаций по бюджетированию.
Часто задаваемые вопросы
Почему затраты на инференс так быстро упали?
Четыре фактора суммируются: улучшения оборудования (2–3× за поколение), оптимизация ПО (непрерывное пакетирование, PagedAttention — 2–3×), эффективность архитектуры моделей (MoE-модели — 3–5×) и квантизация (2–4×). Каждое улучшение умножается на остальные, давая суммарное снижение ~1000× за 3 года.
Что важнее для спроса на GPU — обучение или инференс?
Сейчас доминирует инференс. Обучение передовой модели — разовое событие, требующее тысяч GPU на недели. Обслуживание этой модели требует GPU, работающих 24/7 годами. С сотнями миллионов AI-пользователей, непрерывно генерирующих токены, инференс составляет примерно 67% всех AI-вычислений в 2026 году.
Какой GPU лучше всего подходит для инференса?
Зависит от размера модели. Для крупных моделей (70B+ параметров) H100 и A100 обеспечивают необходимую память и пропускную способность. Для средних моделей (7B–30B) L40S даёт лучшую стоимость за токен. Для малых моделей L4 и даже RTX 4090 могут обслуживать инференс с очень низкими затратами. Полное сравнение в нашем руководстве по лучшим GPU для AI.
Как падение стоимости инференса влияет на цены аренды GPU?
Контринтуитивно, но падение стоимости за токен не снизило арендные ставки GPU. Действует парадокс Джевонса: дешёвый инференс открывает новые сценарии использования, увеличивая общий спрос. Рыночные ставки на H100 оставались стабильными или росли, даже когда стоимость за токен падала, потому что больше клиентов арендуют GPU для нагрузок инференса.
Заменят ли специализированные ASIC GPU для инференса?
Частично. Специализированные чипы, такие как TPU от Google, Inferentia от Amazon и LPU от Groq, обеспечивают превосходную инференс-эффективность для конкретных архитектур моделей. Однако GPU сохраняют преимущества в гибкости (запуск любой модели), зрелости экосистемы и доступности. Вероятный исход — сосуществование: ASIC для высокообъёмного стандартизированного инференса; GPU для всего остального. О стороне обучения в этом уравнении затрат читайте в нашем анализе затрат на обучение AI.