Быстрый ответ: какой GPU выбрать?
Не существует единственного «лучшего GPU для ИИ». Правильный выбор зависит от трёх факторов: что вы делаете (обучение, дообучение или инференс), насколько велика ваша модель (1B параметров или 70B+) и сколько вы готовы потратить (за час и в сумме).
Если вам нужен ответ в одну строку: для крупномасштабного обучения — H100 или B200. Для экономичного дообучения — RTX 4090 или A100. Для промышленного инференса — L40S или L4. Но настоящая история кроется в цифрах — а именно в метрике, которую большинство руководств по GPU игнорируют: стоимость за TFLOP.
Это руководство сосредоточено на этой метрике. Вместо повторения таблиц характеристик, доступных в нашем полном руководстве по GPU, мы анализируем, какой GPU даёт наибольшую производительность ИИ на доллар для вашей конкретной нагрузки.
Стоимость за TFLOP: метрика, которая действительно важна
Сырые TFLOPS (триллионы операций с плавающей запятой в секунду) показывают, насколько быстро GPU вычисляет. Но скорость ничего не значит без контекста. H200 обеспечивает ~1 000 FP16 TFLOPS, но стоит $3.80/час. RTX 4090 обеспечивает ~330 FP16 TFLOPS за $0.60/час. Что на самом деле выгоднее?
Стоимость за TFLOP отвечает на этот вопрос: разделите почасовую стоимость аренды на рейтинг FP16 TFLOPS. Чем ниже — тем лучше.
Результаты контринтуитивны. RTX 4090 — потребительская игровая карта — обеспечивает лучшую стоимость за TFLOP во всей линейке. B200 — новейший флагман NVIDIA для дата-центров — занимает второе место. Популярный H100 находится посередине, а L40S наименее эффективен по стоимости за TFLOP.
Но стоимость за TFLOP — это не вся история. RTX 4090 имеет только 24 ГБ видеопамяти GDDR6X, что ограничивает его моделями, помещающимися в эту память. B200 имеет 192 ГБ HBM3e, что позволяет вместить модели в 8 раз больше. Сырая эффективность должна быть сбалансирована с возможностями.
| GPU | VRAM | FP16 TFLOPS | Облако $/час | Стоимость/TFLOP/час | Цена покупки | TDP |
|---|---|---|---|---|---|---|
| B200 | 192 GB HBM3e | ~2 500 | ~$4.70 | $0.0019 | $45–50K | 1 000W |
| H200 | 141 GB HBM3e | ~1 000 | ~$3.80 | $0.0038 | $30–40K | 700W |
| H100 | 80 GB HBM3 | ~1 000 | ~$3.15 | $0.0032 | ~$25K | 700W |
| A100 80GB | 80 GB HBM2e | ~312 | ~$0.72 | $0.0023 | ~$15K (б/у) | 300W |
| L40S | 48 GB GDDR6X | ~366 | ~$1.50 | $0.0041 | ~$8K | 350W |
| RTX 4090 | 24 GB GDDR6X | ~330 | ~$0.60 | $0.0018 | ~$1 600 | 450W |
Ключевой вывод: Самый дорогой GPU в час — не всегда самый дорогой за единицу работы. Стоимость за TFLOP показывает, что RTX 4090 и B200 являются лидерами эффективности — на противоположных концах спектра возможностей.
Рекомендации по нагрузкам: подбор GPU к задаче
Правильный GPU — не самый быстрый или дешёвый, а тот, который соответствует вашей нагрузке. Вот практическая система принятия решений.
Дообучение малых и средних моделей (7B–13B параметров)
Лучший выбор: RTX 4090 ($0.60/час) или A100 40GB
Дообучение модели с 7B параметрами с LoRA или QLoRA требует примерно 14–20 ГБ VRAM — вполне в рамках 24 ГБ RTX 4090. При $0.60/час на GPU-маркетплейсах 10-часовой сеанс дообучения стоит всего $6. Та же работа на H100 при $3.15/час обойдётся в $31.50 — более чем в 5 раз дороже для нагрузки, которой не нужны дополнительные VRAM или пропускная способность H100.
Для полного дообучения (без LoRA) моделей 13B A100 40GB по ~$0.72/час обеспечивает достаточный объём VRAM за долю стоимости H100.
Предобучение больших моделей (70B+ параметров)
Лучший выбор: H100 или B200 в мульти-GPU кластерах
Предобучение модели с 70B+ параметрами требует 140+ ГБ VRAM только для модели, плюс активации, градиенты и состояния оптимизатора. Ни один GPU, кроме B200 (192 ГБ), не может вместить это в памяти. На практике такие нагрузки выполняются на мульти-GPU кластерах с параллелизмом модели и данных на 8–128+ GPU.
NVLink 4.0 H100 (900 ГБ/с двунаправленная пропускная способность) обеспечивает эффективное межпроцессорное взаимодействие — критически важное для распределённого обучения, где GPU должны обмениваться градиентами при каждом прямом/обратном проходе. B200 идёт дальше с более высокой пропускной способностью и большей памятью, но доступность остаётся ограниченной до 2027 года.
В масштабе общая стоимость ошеломляет. Обучение GPT-4, по имеющимся данным, потребовало 10 000+ GPU A100, работающих месяцами. Даже по ценам маркетплейсов кластер из 1 000 GPU H100, работающий 30 дней, стоит примерно $2.3 миллиона.
Промышленный инференс (пакетная обработка)
Лучший выбор: L40S ($1.50/час) для экономической эффективности
Пакетный инференс — одновременная обработка множества запросов — выигрывает от 48 ГБ GDDR6X VRAM L40S и высокой производительности FP16. Хотя его стоимость за TFLOP выше, чем у RTX 4090, удвоенный объём VRAM позволяет обслуживать более крупные модели и большие размеры пакетов, улучшая пропускную способность на доллар.
Для инференса, где модель помещается в 24 ГБ (большинство моделей 7B после квантизации), RTX 4090 остаётся наиболее экономичным вариантом.
Промышленный инференс (низкая задержка)
Лучший выбор: H200 для скорости, L4 для периферии
Когда задержка одного запроса важнее пропускной способности (чат-боты, API реального времени), пропускная способность памяти 4 800 ГБ/с H200 обеспечивает самую быструю генерацию токенов. L4 ($0.30–$1.00/час) служит бюджетным вариантом для лёгкого инференса на периферии — 24 ГБ VRAM за малую долю стоимости.
Энергопотребление и эксплуатационные расходы
Выбор GPU — это не только вычисления и облачные цены. Если вы владеете оборудованием (или рассматриваете такой вариант), расходы на электричество значительно накапливаются со временем.
| GPU | TDP (Вт) | Годовая стоимость электричества* | Эффективная стоимость $/час (владение 3 года) |
|---|---|---|---|
| B200 | 1 000W | ~$526/год | ~$1.80 |
| H100 / H200 | 700W | ~$368/год | ~$1.05 |
| RTX 4090 | 450W | ~$237/год | ~$0.25 |
| L40S | 350W | ~$184/год | ~$0.40 |
| A100 | 300W | ~$158/год | ~$0.55 |
Предполагается средняя загрузка 60% и стоимость электричества $0.10/кВтч.
TDP B200 1 000W делает его самым энергоёмким GPU в линейке — потребляя более $500/год только на электричество при умеренной загрузке. Для владельцев оборудования в регионах с высокой стоимостью электричества (свыше $0.25/кВтч, что типично для большей части Европы), это существенно влияет на экономику владения GPU по сравнению с облачной арендой.
Анализ окупаемости: покупка vs аренда
Решение о покупке или аренде GPU сводится к загрузке и временному горизонту. Вот расчёт для H100 — наиболее типичная точка принятия решений:
- Цена покупки H100: ~$25 000
- Ставка аренды на маркетплейсе: ~$3.15/час
- Часы до окупаемости: 25 000 / 3.15 = ~7 937 часов
- При работе 24/7: ~11 месяцев до окупаемости
- При загрузке 60%: ~18 месяцев до окупаемости
Добавьте электричество ($0.07/час), накладные расходы на охлаждение ($0.02/час) и обслуживание, и эффективная стоимость владения за 3 года составит примерно $1.05/час — конкурентоспособна с маркетплейсными ценами, но только при устойчивой высокой загрузке.
Критическая переменная — загрузка. Если ваши GPU простаивают 50% времени, вы платите вдвое больше эффективной ставки. Облачная аренда полностью устраняет расходы на простой — вы платите только когда вычисления работают.
Для полного сравнения аренды и покупки, включая охлаждение, помещение, персонал и амортизацию, см. наш подробный анализ затрат.
Перспективы 2026: Blackwell, Rubin и что дальше
Ландшафт GPU быстро меняется. Вот что важно для планирования вашей ИИ-инфраструктуры:
NVIDIA B200 (архитектура Blackwell) — Уже поставляется в ограниченных количествах, B200 обеспечивает примерно 4-кратную производительность обучения по сравнению с H100 при 192 ГБ HBM3e и TDP 1 000W. Лучший выбор для новых крупномасштабных обучающих кластеров, но остаётся в дефиците до 2027 года. Доступность в облаке расширяется у гиперскейлеров и специализированных провайдеров.
Архитектура NVIDIA Rubin — Анонсирована на конец 2026 года, Rubin содержит 336 миллиардов транзисторов и нацелена на 50 PFLOPS инференса FP4. Если поставлена в срок, это примерно 5-кратный скачок по сравнению с Blackwell для пропускной способности инференса. Это кардинально изменит уравнение стоимости за TFLOP — но сроки закупок означают, что большинство команд не получат доступ к оборудованию Rubin до 2027 года.
AMD MI350X и MI355X — Ответ AMD на Blackwell. MI355X продемонстрировал на 30% более быстрый инференс, чем B200 на Llama 3.1 405B, с конкурентоспособными ценами. Растущая экосистема ROCm AMD снижает зависимость от CUDA для инференсных нагрузок. Для подробного сравнения см. наш анализ NVIDIA vs AMD.
Практический вывод: Не покупайте оборудование сегодня, ожидая, что оно останется топовым 3+ года. Поколения GPU сменяются каждые 18–24 месяца, и каждое поколение обеспечивает 2–4-кратную производительность предыдущего. Для большинства команд аренда даёт доступ к новейшему оборудованию без риска амортизации.
Как выбрать: чек-лист для принятия решений
Перед выбором GPU ответьте на пять вопросов:
-
Какая у вас нагрузка? Обучение, дообучение или инференс? У каждого разные требования к вычислениям, памяти и пропускной способности.
-
Насколько велика ваша модель? Модели менее 13B параметров могут работать на GPU с 24 ГБ. Модели свыше 70B требуют мульти-GPU конфигураций с 80+ ГБ на GPU.
-
Каков ваш бюджет в час? Если менее $1/час, ваши варианты — RTX 4090, A100 по спот-ценам или L4. Если $3+/час, доступны H100 или B200.
-
Сколько часов в месяц вы будете использовать? Менее 100 часов — всегда арендуйте. 100–500 часов — арендуйте на маркетплейсах. Более 500 часов при высокой загрузке — рассмотрите покупку.
-
Как долго вам нужно это оборудование? Менее 18 месяцев — арендуйте (избежите амортизации). 18+ месяцев при высокой загрузке — покупка может окупиться. Для более глубокого сравнения архитектур GPU, включая то, как CPU и GPU дополняют друг друга, см. наше руководство GPU vs CPU.
Ключевой вывод: «Лучший» GPU — это самый дешёвый, который может выполнить вашу конкретную нагрузку. RTX 4090, дообучающий модель 7B — лучшее вложение, чем H100, делающий ту же работу: вы получаете тот же результат при 1/5 стоимости.
Часто задаваемые вопросы
Какой GPU лучше всего подходит для обучения больших языковых моделей?
Для моделей свыше 70B параметров NVIDIA H100 остаётся стандартом — он предлагает 80 ГБ HBM3, NVLink 4.0 для мульти-GPU масштабирования и наиболее зрелую программную экосистему. B200 — следующая ступень с 192 ГБ HBM3e и примерно 4-кратной производительностью обучения, но доступность ограничена. Для моделей меньшего размера (7B–13B) RTX 4090 или A100 обеспечивают отличную производительность за малую долю стоимости. Для подробного сравнения вариантов NVIDIA поколения Ampere см. наш обзор A100 vs A6000 vs A2000.
Подходит ли RTX 4090 для ИИ?
Да — это один из наиболее экономичных GPU для дообучения и инференса ИИ на малых и средних моделях. Его 24 ГБ VRAM обрабатывают модели до ~13B параметров (с квантизацией), а его стоимость за TFLOP — лучшая в отрасли. Ограничение — VRAM: для моделей, превышающих 24 ГБ, нужен серверный GPU с большим объёмом памяти. Он также не поддерживает NVLink, что делает мульти-GPU масштабирование менее эффективным по сравнению с серверными картами.
Стоит ли покупать или арендовать GPU для ИИ?
Арендуйте, если загрузка ниже 60% или временной горизонт менее 18 месяцев. Рынок GPU движется быстро — новая архитектура каждые 2 года означает, что купленное оборудование быстро обесценивается. Аренда на GPU-маркетплейсах даёт доступ к новейшему оборудованию за $0.60–$3.15/час без капитальных вложений. Покупайте только при устойчивых, предсказуемых нагрузках 500+ часов/месяц на протяжении 2+ лет.
Что такое стоимость за TFLOP и почему это важно?
Стоимость за TFLOP делит почасовую стоимость аренды GPU на производительность в TFLOPS с плавающей запятой. Она нормализует производительность между моделями GPU, показывая, какая карта даёт больше всего вычислений ИИ на доллар. GPU с низкой почасовой ставкой, но низкой производительностью может фактически стоить дороже за единицу работы, чем более дорогой, но более производительный GPU. Это ближайшая к «отдаче на вложенные средства» метрика в GPU-вычислениях.
Сколько VRAM мне нужно для ИИ?
Грубое правило: модель с N миллиардами параметров требует примерно 2×N ГБ VRAM для инференса в FP16 и 4×N ГБ для обучения (из-за градиентов и состояний оптимизатора). Модель 7B требует ~14 ГБ для инференса, ~28 ГБ для полного дообучения. Квантизация (INT8, INT4) может снизить требования к VRAM в 2–4 раза. Используйте RTX 4090 (24 ГБ) для моделей до ~13B квантизированных, A100/L40S (48–80 ГБ) для моделей до ~40B и H100/H200/B200 (80–192 ГБ) для моделей 70B+.