Цены на облачные GPU: полная картина
Заявленная почасовая ставка облачного GPU — это не то, что вы фактически платите. Реальная стоимость облачных GPU включает скрытые комиссии, штрафы за гранулярность тарификации и накладные расходы на инфраструктуру, которые могут увеличить ваш счёт на 20–40% сверх заявленной цены.
Это руководство фокусируется на том, что упускают другие сравнения цен: общая стоимость выполнения GPU-нагрузки, а не просто цена на витрине. Мы сравниваем три типа провайдеров, раскрываем скрытые расходы и предлагаем пять конкретных стратегий для сокращения расходов на GPU.
Для сравнения характеристик GPU и рекомендаций по нагрузкам см. наше руководство по лучшим GPU для AI. Эта статья посвящена провайдерам и ценообразованию — где вы арендуете, а не что.
Три типа провайдеров облачных GPU
Рынок облачных GPU имеет три отчётливых уровня, каждый со своей структурой ценообразования, компромиссами и целевыми клиентами.
Гиперскейлеры (AWS, Google Cloud, Azure)
Крупные облачные провайдеры предлагают GPU-инстансы как часть своей широкой инфраструктурной платформы. Вы получаете корпоративные SLA, глобальные регионы, глубокую интеграцию с управляемыми сервисами (хранилище, ML-платформы, мониторинг) и гарантированную доступность для зарезервированных инстансов.
Наценка: $3,00–$6,98/час за H100 по требованию. Зарезервированные инстансы (обязательства на 1–3 года) снижают эту цену на 30–50%, но требуют долгосрочной привязки.
Специализированные GPU-облака (Lambda, CoreWeave)
Фокусируются исключительно на GPU-инфраструктуре. Эти провайдеры предлагают конкурентные цены ($2,00–$3,00/час за H100), конфигурации, оптимизированные для AI-нагрузок, и поддержку, ориентированную на AI, — но меньше управляемых сервисов, чем у гиперскейлеров.
GPU-маркетплейсы (GPUnex, Vast.ai, RunPod)
Агрегируют GPU-мощности из сотен распределённых дата-центров. Объединяя предложение от множества провайдеров, маркетплейсы предоставляют наиболее конкурентные цены ($1,49–$2,50/час за H100) с гибкой тарификацией — часто посекундной, а не почасовой. Компромиссы включают переменную надёжность и менее интегрированный инструментарий.
Сравнение цен по моделям GPU
Вот сколько фактически стоит каждый GPU у разных типов провайдеров в начале 2026 года:
| Модель GPU | Гиперскейлер по требованию | Гиперскейлер зарезервированный | Специализированное облако | GPU-маркетплейс |
|---|---|---|---|---|
| H100 80GB | $3,00–$6,98/час | $2,00–$4,50/час | $2,00–$3,00/час | $1,49–$2,50/час |
| A100 80GB | $1,50–$3,50/час | $1,00–$2,50/час | $0,80–$1,50/час | $0,72–$1,50/час |
| L40S 48GB | $1,20–$2,50/час | $0,80–$1,80/час | $0,80–$1,50/час | $0,60–$1,20/час |
| L4 24GB | $0,50–$1,00/час | $0,30–$0,70/час | $0,30–$0,60/час | $0,20–$0,50/час |
| RTX 4090 24GB | Н/Д (не предлагается) | Н/Д | $0,40–$0,80/час | $0,40–$0,80/час |
Ключевое наблюдение: Разрыв в цене между гиперскейлером по требованию и маркетплейсом составляет 2–4,7x за одинаковое GPU-оборудование. Для H100 разница между $6,98/час (AWS по требованию) и $1,49/час (спот на маркетплейсе) составляет $5,49/час — что за месяц превращается в $4 008 при непрерывной работе одного GPU.
Скрытые расходы, которые раздувают ваш счёт за GPU
Почасовая ставка GPU — это лишь часть картины. Пять категорий скрытых расходов регулярно застают команды врасплох:
1. Комиссии за исходящий трафик (Egress)
Передача данных из сети облачного провайдера стоит денег — обычно $0,05–$0,12 за ГБ. Обучение модели, которая скачивает 1 ТБ обучающих данных и регулярно экспортирует контрольные точки, может добавить $50–$120 в виде комиссий за исходящий трафик за один цикл обучения. Мультиоблачные рабочие процессы (обучение у одного провайдера, инференс у другого) умножают эти расходы.
2. Расходы на хранилище
GPU-инстансам нужно дисковое пространство для датасетов, контрольных точек модели и логов. Облачное хранилище стоит $0,02–$0,08/ГБ/месяц. Датасет объёмом 5 ТБ, хранящийся 3 месяца, обходится в $300–$1 200 — невидимо в почасовой ставке GPU, но весьма заметно в счёте.
3. Сетевые расходы и балансировка нагрузки
Производственный инференс требует балансировщиков нагрузки, API-шлюзов и межузловой сетевой инфраструктуры. Эти сервисы добавляют $50–$200+/месяц в зависимости от объёма трафика. Кластеры для обучения на нескольких GPU несут дополнительные расходы на высокоскоростную межузловую сеть.
4. Минимальные обязательства и округление
Некоторые провайдеры тарифицируют поурочными интервалами — задача на 35 минут стоит столько же, сколько задача на 60 минут. Посекундная тарификация (предлагаемая некоторыми маркетплейсами) устраняет эту потерю. Для нагрузок с пиковым характером и множеством коротких задач почасовая тарификация может тратить 15–30% вашего бюджета на неиспользованное время.
5. API и комиссии за управляемые сервисы
Управляемые ML-сервисы (SageMaker, Vertex AI) взимают дополнительные комиссии сверх стоимости GPU-вычислений. Они могут добавить 10–30% к базовой стоимости GPU за удобство управляемых конвейеров обучения и развёртывания.
Ключевой вывод: Нагрузка, которая стоит $3,15/час в GPU-вычислениях, может обойтись в $4,00–$4,50/час в совокупности, если добавить исходящий трафик, хранилище, сеть и комиссии за управление. Всегда рассчитывайте общую стоимость вашей нагрузки, а не только строку GPU.
Как сократить расходы на облачные GPU на 40%
Пять проверенных стратегий, которые в совокупности могут снизить общие расходы на GPU на 30–40%:
1. Используйте спот/вытесняемые инстансы (экономия 15–20%)
Спот-инстансы предлагают скидки 40–60% по сравнению с ценами по требованию. Компромисс: они могут быть прерваны с коротким уведомлением (обычно от 2 минут до 2 часов). Для отказоустойчивых нагрузок — обучение с контрольными точками, пакетная обработка данных, некритичный инференс — спот-инстансы являются наибольшим рычагом экономии.
Лучше всего подходит для: обучение моделей с регулярными контрольными точками, предобработка данных, пакетный инференс, эксперименты.
Не подходит для: производственный инференс для живых пользователей, задачи с критичными сроками, нагрузки, не допускающие прерывания.
2. Правильно выбирайте размер GPU (экономия 8–12%)
Многие команды по умолчанию выбирают самый мощный GPU «на всякий случай». Нагрузка, которая отлично работает на A100 ($0,72/час), не нуждается в H100 ($3,15/час). Наше руководство по лучшим GPU для AI предоставляет систему принятия решений по нагрузкам — правильный подбор GPU к задаче может снизить расходы на 50%+ для избыточно обеспеченных нагрузок.
Распространённые ошибки: использование H100 для инференса, когда достаточно L40S. Использование A100 для дообучения малых моделей, когда подходит RTX 4090. Запуск пакетного инференса на инстансах по требованию, когда доступен спот.
3. Планируйте и автомасштабируйте (экономия 5–8%)
GPU-инстансы, работающие 24/7, когда ваша команда работает 8 часов в день, тратят две трети бюджета впустую. Политики автомасштабирования, которые запускают GPU для обучающих задач и завершают их при простое, могут вернуть значительные потери. Даже простое планирование — «GPU включены в 8:00, выключены в 20:00» — экономит 50% на инстансах для разработки.
4. Мигрируйте нагрузки на маркетплейсы (экономия 10–15%)
Для нагрузок, не требующих управляемых сервисов конкретного гиперскейлера, переход на GPU-маркетплейс может сэкономить в 3–6 раз на вычислениях. Ключевое требование: ваша нагрузка должна быть контейнеризирована (Docker) и не зависеть от API конкретного провайдера (SageMaker, Vertex AI).
5. Используйте зарезервированные/фиксированные мощности (дополнительная экономия 5–10%)
Для предсказуемых, устойчивых нагрузок (производственный инференс, постоянное обучение) обязательства по зарезервированным мощностям предлагают скидки 30–50% по сравнению с ценами по требованию. Компромисс — обязательство — обычно на 1–3 года. Комбинируйте зарезервированные мощности для базовой нагрузки со спотом/маркетплейсами для переменной нагрузки.
Подробный разбор по провайдерам
AWS (Amazon Web Services)
GPU-инстансы: P5 (H100), P4 (A100), G5 (A10G), G6 (L4). Цены: H100 по требованию: ~$4,50–$6,98/час. Зарезервированные (1 год): ~$3,00–$4,50/час. Спот: ~$1,50–$2,50/час. Сильные стороны: Самая широкая экосистема управляемых сервисов (SageMaker, EKS, S3), глобальная доступность, корпоративная поддержка. На что обратить внимание: Комиссии за исходящий трафик ($0,09/ГБ), сложные ценовые уровни, колебания доступности инстансов по требованию.
Google Cloud Platform
GPU-инстансы: A3 (H100), A2 (A100), G2 (L4). Цены: H100 по требованию: ~$3,50–$5,50/час. С обязательством (1 год): ~$2,50–$3,50/час. Спот: ~$1,50–$2,00/час. Сильные стороны: Сильная альтернатива в виде TPU, отличная интеграция с JAX/TensorFlow, управляемая платформа Vertex AI, конкурентные спот-цены. На что обратить внимание: Меньший парк GPU, чем у AWS, ограниченная доступность в некоторых регионах.
Microsoft Azure
GPU-инстансы: ND H100 (H100), NC A100 (A100), NC T4 (T4). Цены: H100 по требованию: ~$3,00–$5,00/час. Зарезервированные (1 год): ~$2,00–$3,50/час. Сильные стороны: Интеграция с OpenAI (Azure OpenAI Service), сильная корпоративная безопасность и идентификация, возможности гибридного облака. На что обратить внимание: Доступность GPU может быть ограничена в популярных регионах.
GPU-маркетплейсы
Доступные GPU: H100, A100, L40S, L4, RTX 4090 и другие. Цены: H100: $1,49–$2,50/час. A100: $0,72–$1,50/час. RTX 4090: $0,40–$0,80/час. Сильные стороны: Самые низкие цены, гибкая тарификация (посекундная на некоторых платформах), отсутствие обязательств, широкий выбор GPU, включая потребительские карты. На что обратить внимание: Переменная надёжность в зависимости от провайдера, меньше управляемого инструментария, может потребоваться больше самостоятельной настройки.
Когда использовать какой тип провайдера
| Сценарий | Лучший тип провайдера | Почему |
|---|---|---|
| Корпоративный производственный инференс | Гиперскейлер | SLA, глобальная доступность, управляемые сервисы |
| Масштабное обучение (1000+ GPU) | Гиперскейлер или специализированное облако | Гарантированная мощность, сетевое соединение NVLink |
| Оптимизированное по стоимости обучение | GPU-маркетплейс (спот) | Самые низкие цены, контрольные точки компенсируют прерывания |
| Разработка и эксперименты | GPU-маркетплейс | Посекундная тарификация, без обязательств, дешёвые итерации |
| Маленькая команда / стартап | GPU-маркетплейс | Самый низкий порог входа, гибкое масштабирование, без минимумов |
| Пакетный инференс | GPU-маркетплейс или спот | Допускает прерывание, чувствителен к цене |
| Регулируемые нагрузки (финансы, здравоохранение) | Гиперскейлер | Сертификаты соответствия, аудиторские следы |
По вопросу «аренда или покупка» — имеет ли облачная аренда больше смысла, чем владение оборудованием — см. наш подробный анализ стоимости. Для стартапов, планирующих первые расходы на GPU, см. наш руководство по стоимости вычислений для AI-стартапов.
Часто задаваемые вопросы
Какой самый дешёвый способ арендовать H100?
GPU-маркетплейсы предлагают самые низкие ставки на H100 — $1,49–$2,50/час. Спот-инстансы гиперскейлеров идут следующими по цене — $1,50–$2,50/час, но могут быть прерваны. Самый дешёвый надёжный вариант — маркетплейс с провайдером, имеющим высокий показатель времени безотказной работы. Для некритичных по времени нагрузок спот-цены на любой платформе предлагают самые глубокие скидки.
Действительно ли скрытые расходы настолько значительны?
Да. Для типичной обучающей нагрузки скрытые расходы (исходящий трафик, хранилище, сеть) добавляют 20–40% сверх счёта за GPU-вычисления. Инстанс H100 за $3,15/час, выполняющий обучающую задачу с 2 ТБ передачи данных и 500 ГБ хранилища контрольных точек, фактически может стоить $4,00–$4,50/час в совокупности. Всегда оценивайте общую стоимость нагрузки, а не только почасовую ставку GPU.
Стоит ли использовать одного провайдера или несколько?
Несколько. Используйте GPU-маркетплейсы для чувствительных к стоимости нагрузок (разработка, пакетная обработка, инференс). Используйте гиперскейлеры для производственного инференса и регулируемых нагрузок. Используйте спот-цены у всех провайдеров для отказоустойчивых задач. Диверсификация предотвращает привязку и позволяет оптимизировать стоимость на каждом уровне.
Что такое посекундная тарификация и имеет ли она значение?
Посекундная тарификация взимает плату только за точное время активности вашего GPU. Почасовая тарификация округляет в большую сторону — задача на 35 минут стоит столько же, сколько 60 минут. Для нагрузок с множеством коротких задач (инференс, эксперименты, CI/CD) посекундная тарификация экономит 15–30%. Для длительных обучающих задач разница незначительна.
Как изменились цены на GPU за последний год?
Цены на H100 упали на 44% между июнем 2024 и июнем 2025, благодаря расширению предложения и конкуренции маркетплейсов. Цены на A100 снизились ещё больше по мере устаревания GPU. Ожидается, что цены продолжат постепенно снижаться по мере увеличения производства NVIDIA и AMD, хотя GPU нового поколения (B200, Rubin) будут иметь премиальные цены при запуске. Для более широкого рыночного контекста см. наш анализ рынка OpenAI-NVIDIA.