Главные цифры: сколько реально стоят передовые модели
Обучение передовой AI-модели — один из самых дорогих инженерных проектов в истории человечества. Вот реальные цифры:
| Модель | Год | Оценочная стоимость обучения | GPU-оборудование | Длительность обучения |
|---|---|---|---|---|
| GPT-3 (175B) | 2020 | ~$4,6 млн | ~1 000 V100 GPU | ~34 дня |
| PaLM (540B) | 2022 | ~$12 млн | 6 144 TPU v4 | ~50 дней |
| GPT-4 (~1,8T MoE) | 2023 | ~$79 млн | 10 000+ A100 GPU | ~100 дней |
| Gemini Ultra | 2024 | ~$191 млн | 16 384 TPU v5 | ~130 дней |
| Llama 3.1 405B | 2024 | ~$60 млн | 16 384 H100 GPU | ~54 дня |
| DeepSeek R1 | 2025 | ~$294 000 | ~2 000 H800 GPU | ~55 дней |
Цифра DeepSeek R1 выделяется. Пока передовые лаборатории тратят сотни миллионов, DeepSeek достиг конкурентной производительности менее чем за $300 000, используя агрессивные оптимизации эффективности — доказав, что стоимость не является исключительно функцией качества модели.
Структура затрат на обучение: вычисления, данные и инженерия
Стоимость обучения — это не только аренда GPU. Вот куда реально уходят деньги:
GPU-вычисления (65%) — доминирующая статья расходов. Для запуска обучения за $79M примерно $51 миллион уходит на аренду GPU или амортизированные затраты на оборудование. Это компонент затрат, наиболее чувствительный к выбору провайдера и эффективности оборудования.
Подготовка данных (15%) включает веб-скрейпинг, фильтрацию, дедупликацию, токенизацию и разметку для RLHF. Высококачественные данные стоят всё дороже — синтетические данные и автоматизированные конвейеры снижают затраты, но не устраняют их.
Инженерия (12%) покрывает ML-исследователей, инфраструктурных инженеров и вспомогательный персонал, которые проектируют, запускают и отлаживают обучение. Топовые AI-исследователи получают $1M+ годовой компенсации. Передовой запуск обучения требует команды из 20–50+ инженеров на несколько месяцев.
Инфраструктура (8%) включает хранилище (петабайты обучающих данных), высокоскоростные сети (400 GbE между узлами), программное обеспечение оркестрации и мониторинг. Часто недооценивается в начальных бюджетах.
Парадокс затрат: почему расходы растут при обвале удельных цен
Вот контринтуитивная реальность: общие затраты на обучение растут экспоненциально, тогда как стоимость единицы вычислений падает экспоненциально.
- Общие расходы растут с коэффициентом 2,4× в год — лаборатории обучают более крупные модели на большем объёме данных
- Стоимость за FLOP падает примерно в 10 раз в год — лучшее оборудование, лучшие алгоритмы
- Затраты на обучение как процент от выручки растут — давление ощущают даже компании с триллионной капитализацией
Этот парадокс существует потому, что лаборатории масштабируются быстрее, чем прирост эффективности может компенсировать. Каждое новое поколение моделей в 5–10 раз больше предыдущего, тогда как прирост эффективности снижает стоимость за FLOP в 2–3 раза за поколение. Чистый эффект: больше расходов несмотря на более дешёвые вычисления.
Что это означает для спроса на GPU: Даже по мере того как отдельные GPU становятся мощнее и эффективнее, общее количество GPU, необходимых для передового обучения, продолжает расти. Это поддерживает спрос — и ценовую власть — для провайдеров GPU-инфраструктуры.
Стоимость обучения по размеру модели: от 7B до 1T+ параметров
Не все обучают передовые модели. Вот стоимость обучения при разных масштабах:
| Размер модели | Типичные обучающие вычисления | Оценочная стоимость (H100 маркетплейс) | Оценочная стоимость (AWS) |
|---|---|---|---|
| 1B параметров | ~1 000 GPU-часов | ~$1 500–$2 500 | ~$4 000–$7 000 |
| 7B параметров | ~10 000 GPU-часов | ~$15 000–$25 000 | ~$40 000–$70 000 |
| 13B параметров | ~25 000 GPU-часов | ~$37 500–$62 500 | ~$100 000–$175 000 |
| 70B параметров | ~200 000 GPU-часов | ~$300 000–$500 000 | ~$800 000–$1,4M |
| 405B параметров | ~1 500 000 GPU-часов | ~$2,2M–$3,7M | ~$6M–$10,5M |
| 1T+ (передовые) | ~10 000 000+ GPU-часов | ~$15M–$25M | ~$40M–$70M |
Примечание: это приблизительные оценки. Фактические затраты значительно варьируются в зависимости от эффективности обучения, качества данных, неудач настройки гиперпараметров и утилизации оборудования.
2–3-кратная разница в стоимости между маркетплейсом и гиперскейлером последовательна на всех масштабах. Для стартапа, обучающего 7B-модель, это разница между $15K и $40K — существенная, но управляемая. Для передовой лаборатории, обучающей 1T+ модель, это десятки миллионов долларов.
Как выбор провайдера влияет на бюджет обучения
Где вы арендуете GPU — одно из решений с наибольшим кредитным плечом для затрат в AI:
| Тип провайдера | Месячная стоимость H100 (24/7) | Стоимость за 12 месяцев | Экономия vs AWS |
|---|---|---|---|
| AWS (on-demand) | ~$2 800 | ~$33 600 | — |
| Специализированное облако (Lambda) | ~$2 150 | ~$25 800 | 23% |
| Маркетплейс (верифицированный хост) | ~$1 150 | ~$13 800 | 59% |
| Зарезервированные/committed | ~$1 700 | ~$20 400 | 39% |
Для запуска обучения на 1 000 GPU-часов разница между AWS on-demand и маркетплейсом составляет примерно $2 000. Масштабируйте это до 100 000 GPU-часов, и разница составит $200 000. На передовом масштабе выбор провайдера влияет на бюджеты на миллионы.
Детальное сравнение цен у всех крупных провайдеров смотрите в нашем руководстве по ценам на облачные GPU. Для понимания, какую модель GPU выбрать, смотрите наше руководство по лучшим GPU для AI.
Ключевой вывод: Многие команды по умолчанию используют своего текущего облачного провайдера (AWS, GCP, Azure) для обучения, потому что это удобно. Это удобство может стоить на 40–60% дороже альтернатив на маркетплейсах. Для запусков обучения свыше $10 000 30 минут, потраченных на настройку аккаунта на маркетплейсе, окупаются сотни раз.
Прорывы в эффективности: обучение лучших моделей за меньшие деньги
Пример DeepSeek R1 ($294 000 за конкурентную производительность) иллюстрирует, что грубая сила затрат — не единственный путь. Ключевые техники эффективности в 2026 году:
Mixture of Experts (MoE): Только подмножество параметров модели активируется на каждый вход, снижая вычисления на один прямой проход в 4–8 раз. GPT-4, по сообщениям, использует MoE — модель с ~1,8T параметров, где только ~280B параметров активируются на токен. Это радикально снижает требования к FLOP обучения на эффективный параметр.
Квантизация при обучении: Обучение с более низкой точностью (BF16, FP8) с самого начала снижает требования к памяти и вычислениям в 2–4 раза при минимальном влиянии на качество. GPU NVIDIA Blackwell нативно поддерживают обучение в FP4.
Качество данных важнее количества: Исследования OpenAI показывают, что обучение на меньших, но более качественных датасетах может сравниться с моделями, обученными на 10 раз большем объёме данных низкого качества. Инвестиции в курирование данных снижают требования к вычислениям.
Архитектурные инновации: Техники, такие как Ring Attention (для длинного контекста), FlashAttention (для эффективности памяти) и спекулятивное декодирование (для ускорения инференса), комбинируют прирост эффективности. Каждое поколение техник снижает объём вычислений, необходимый для заданного уровня качества.
Дистилляция: Обучение меньшей модели-«ученика» для имитации более крупной модели-«учителя» может достичь 80–95% производительности учителя при в 10–100 раз более низкой стоимости обучения и инференса.
Прогнозы: куда движутся затраты на обучение (2026–2028)
Верхняя граница продолжает расти. Дарио Амодеи из Anthropic заявил, что передовые модели могут стоить $10 миллиардов для обучения к 2028 году. Будет ли какая-либо отдельная модель реально стоить столько, зависит от прироста эффективности и экономики убывающей отдачи.
Нижняя граница продолжает падать. В то же время стоимость обучения модели «эквивалента GPT-4» продолжает снижаться — с $79M в 2023 году до оценочных $5–$10M в 2026 году с использованием оборудования и техник эффективности текущего поколения. То, что было передовым и дорогим два года назад, становится доступным для хорошо финансированных стартапов.
Следствие для спроса на GPU: Оба тренда поддерживают спрос на GPU. Передовые лаборатории нуждаются в большем количестве GPU для более крупных моделей. Меньшие организации нуждаются в GPU для обучения того, что было невозможным совсем недавно. Общий адресуемый рынок обучающих вычислений расширяется в обоих направлениях.
О том, как затраты на инференс следуют аналогичному, но ещё более крутому снижению, читайте в нашем анализе экономики инференса. Руководство по бюджетированию для стартапов — в нашем руководстве по затратам стартапов на вычисления.
Часто задаваемые вопросы
Сколько стоит дообучение модели?
Дообучение радикально дешевле предобучения. Дообучение 7B-модели стоит примерно $50–$500 на GPU-маркетплейсе (несколько сотен GPU-часов). Дообучение 70B-модели стоит $500–$5 000. Техники LoRA и QLoRA дополнительно снижают эти затраты в 5–10 раз. Дообучение доступно практически любой команде с несколькими сотнями долларов.
Почему обучение GPT-4 такое дорогое?
Масштаб. GPT-4, по сообщениям, обучался на 13 триллионах токенов с использованием 10 000+ A100 GPU в течение примерно 100 дней. По рыночным ставкам A100 (~$1,00/час) 10 000 GPU за 2 400 часов — это $24 миллиона только на вычисления — а фактические затраты были выше из-за перезапусков обучения, настройки гиперпараметров и инфраструктурных накладных расходов.
Можно ли обучить полезную AI-модель менее чем за $1 000?
Да. Дообучение существующих опенсорсных моделей (Llama 3, Mistral) на доменно-специфичных данных можно выполнить за $50–$500. Обучение небольшой модели (1B–3B параметров) с нуля стоит $1 000–$5 000. Ключ — использование предобученных моделей и эффективных техник, таких как LoRA, вместо обучения с нуля.
Как стоимость обучения влияет на AI-рынок?
Высокие затраты на обучение создают барьеры входа — только хорошо финансированные организации могут обучать передовые модели. Это концентрирует власть среди нескольких лабораторий (OpenAI, Anthropic, Google, Meta). Однако опенсорсные модели (Llama, Mistral, DeepSeek) и снижающиеся затраты на дообучение демократизируют доступ к способному AI. Барьер затрат на обучение высок для передовых моделей, но низок для прикладного AI.
Будут ли затраты на обучение продолжать расти?
Общие расходы на передовое обучение, вероятно, продолжат расти (к $1B+), потому что лаборатории стремятся к более крупным и способным моделям. Но стоимость достижения любого заданного уровня производительности быстро падает — то, что стоило $79M в 2023, будет стоить менее $10M к 2026. Оба утверждения одновременно верны.
Как оценить затраты на обучение для моего проекта?
Правило: модель с N миллиардами параметров, обученная на T токенах, требует примерно (6 × N × T) FLOP. Разделите на скорость GPU в FLOP/с, чтобы получить GPU-часы. Умножьте на почасовую ставку. Пример: 7B-модель, обученная на 1T токенов, требует ~42 × 10^18 FLOP. H100 обеспечивает ~990 TFLOPS (BF16). Это примерно 11 800 GPU-часов, или около $17 700 по рыночной ставке $1,50/час. Добавьте 30–50% на накладные расходы (перезапуски, настройка, оценка).