Os Números Principais: Quanto Custam Realmente os Modelos Frontier
Treinar um modelo de AI frontier é um dos projetos de engenharia mais caros da história humana. Eis os números reais:
| Modelo | Ano | Custo Estimado de Treino | Hardware GPU | Duração do Treino |
|---|---|---|---|---|
| GPT-3 (175B) | 2020 | ~$4,6 milhões | ~1.000 GPUs V100 | ~34 dias |
| PaLM (540B) | 2022 | ~$12 milhões | 6.144 chips TPU v4 | ~50 dias |
| GPT-4 (~1,8T MoE) | 2023 | ~$79 milhões | 10.000+ GPUs A100 | ~100 dias |
| Gemini Ultra | 2024 | ~$191 milhões | 16.384 chips TPU v5 | ~130 dias |
| Llama 3.1 405B | 2024 | ~$60 milhões | 16.384 GPUs H100 | ~54 dias |
| DeepSeek R1 | 2025 | ~$294.000 | ~2.000 GPUs H800 | ~55 dias |
O número do DeepSeek R1 destaca-se. Enquanto os laboratórios frontier gastam centenas de milhões, a DeepSeek alcançou desempenho competitivo por menos de $300.000 usando otimizações agressivas de eficiência — provando que o custo não é puramente uma função da qualidade do modelo.
Decomposição dos Custos de Treino: Computação, Dados e Engenharia
O custo de treino não é apenas aluguer de GPU. Eis para onde o dinheiro realmente vai:
Computação GPU (65%) é o custo dominante. Para uma execução de treino de $79M, aproximadamente $51 milhões vão para aluguer de GPU ou custos de hardware amortizados. Esta é a componente de custo mais sensível à escolha do fornecedor e eficiência do hardware.
Preparação de dados (15%) inclui web crawling, filtragem, deduplicação, tokenização e rotulagem humana para RLHF. Dados de alta qualidade são cada vez mais caros — dados sintéticos e pipelines automatizados estão a reduzir custos mas não a eliminá-los.
Engenharia (12%) cobre os investigadores de ML, engenheiros de infraestrutura e pessoal de suporte que projetam, executam e depuram o treino. Os melhores investigadores de AI recebem compensação anual de $1M+. Uma execução de treino frontier requer uma equipa de 20–50+ engenheiros durante meses.
Infraestrutura (8%) inclui armazenamento (petabytes de dados de treino), rede de alta velocidade (400 GbE entre nós), software de orquestração e monitorização. Frequentemente subestimada nos orçamentos iniciais.
O Paradoxo dos Custos: Porque é que os Gastos Crescem Enquanto os Custos Unitários Colapsam
Eis a realidade contra-intuitiva: os custos totais de treino estão a subir exponencialmente enquanto o custo por unidade de computação está a cair exponencialmente.
- O gasto total cresce a 2,4× por ano — os laboratórios treinam modelos maiores com mais dados
- O custo por FLOP cai a aproximadamente 10× por ano — melhor hardware, melhores algoritmos
- O custo de treino como percentagem da receita está a aumentar — mesmo empresas de triliões de dólares sentem a pressão
Este paradoxo existe porque os laboratórios estão a escalar mais rápido do que os ganhos de eficiência conseguem compensar. Cada nova geração de modelos é 5–10× maior do que a anterior, enquanto os ganhos de eficiência reduzem os custos por FLOP em 2–3× por geração. O efeito líquido: mais gastos apesar de computação mais barata.
O que isto significa para a procura de GPU: Mesmo que GPUs individuais se tornem mais poderosas e eficientes, o número total de GPUs necessário para treino frontier continua a crescer. Isto sustenta a procura — e o poder de definir preços — para fornecedores de infraestrutura GPU.
Custo de Treino por Tamanho de Modelo: De 7B a 1T+ Parâmetros
Nem todos treinam modelos frontier. Eis o que o treino custa a diferentes escalas:
| Tamanho do Modelo | Computação de Treino Típica | Custo Estimado (marketplace H100) | Custo Estimado (AWS) |
|---|---|---|---|
| 1B parâmetros | ~1.000 GPU-horas | ~$1.500–$2.500 | ~$4.000–$7.000 |
| 7B parâmetros | ~10.000 GPU-horas | ~$15.000–$25.000 | ~$40.000–$70.000 |
| 13B parâmetros | ~25.000 GPU-horas | ~$37.500–$62.500 | ~$100.000–$175.000 |
| 70B parâmetros | ~200.000 GPU-horas | ~$300.000–$500.000 | ~$800.000–$1,4M |
| 405B parâmetros | ~1.500.000 GPU-horas | ~$2,2M–$3,7M | ~$6M–$10,5M |
| 1T+ (frontier) | ~10.000.000+ GPU-horas | ~$15M–$25M | ~$40M–$70M |
Nota: Estas são estimativas aproximadas. Os custos reais variam significativamente com base na eficiência do treino, qualidade dos dados, falhas de ajuste de hiperparâmetros e utilização do hardware.
A diferença de custo de 2–3× entre marketplace e preços de hyperscaler é consistente em todas as escalas. Para uma startup a treinar um modelo 7B, é a diferença entre $15K e $40K — significativa mas gerível. Para um laboratório frontier a treinar um modelo 1T+, são dezenas de milhões de dólares.
Como a Escolha do Fornecedor Impacta os Orçamentos de Treino
Onde aluga GPUs é uma das decisões de custo com maior alavancagem em AI:
| Tipo de Fornecedor | Custo Mensal H100 (24/7) | Custo em 12 Meses | Poupança vs. AWS |
|---|---|---|---|
| AWS (on-demand) | ~$2.800 | ~$33.600 | — |
| Cloud especializada (Lambda) | ~$2.150 | ~$25.800 | 23% |
| Marketplace (host verificado) | ~$1.150 | ~$13.800 | 59% |
| Reservado/comprometido | ~$1.700 | ~$20.400 | 39% |
Para uma execução de treino de 1.000 GPU-horas, a diferença entre AWS on-demand e um marketplace é aproximadamente $2.000. Escale isso para uma execução de 100.000 GPU-horas, e a diferença é $200.000. Em escala frontier, a escolha do fornecedor impacta orçamentos em milhões.
Para comparações de preços detalhadas entre todos os principais fornecedores, consulte o nosso guia de preços de GPU cloud. Para compreender qual modelo de GPU escolher, consulte o nosso guia da melhor GPU para AI.
Ponto-chave: Muitas equipas recorrem por defeito ao seu fornecedor cloud existente (AWS, GCP, Azure) para treino porque é conveniente. Esta conveniência pode custar 40–60% mais do que alternativas de marketplace. Para execuções de treino superiores a $10.000, os 30 minutos gastos a configurar uma conta de marketplace pagam-se a si mesmos centenas de vezes.
Avanços de Eficiência: Treinar Melhores Modelos por Menos
O exemplo do DeepSeek R1 ($294.000 para desempenho competitivo) ilustra que gasto bruto não é o único caminho. Técnicas-chave de eficiência em 2026:
Mixture of Experts (MoE): Apenas um subconjunto de parâmetros do modelo ativa por entrada, reduzindo a computação por forward pass em 4–8×. O GPT-4 usa reportedly MoE — um modelo de ~1,8T parâmetros onde apenas ~280B parâmetros ativam por token. Isto reduz dramaticamente os requisitos de FLOP de treino por parâmetro efetivo.
Treino com consciência de quantização: Treinar em menor precisão (BF16, FP8) desde o início reduz os requisitos de memória e computação em 2–4× com impacto mínimo na qualidade. As GPUs NVIDIA Blackwell suportam nativamente treino FP4.
Qualidade de dados sobre quantidade: A investigação da OpenAI mostra que treinar com conjuntos de dados menores e de maior qualidade pode igualar modelos treinados com 10× mais dados de menor qualidade. O investimento em curadoria de dados reduz os requisitos de computação.
Inovações de arquitetura: Técnicas como Ring Attention (para contexto longo), FlashAttention (para eficiência de memória) e decodificação especulativa (para inferência mais rápida) combinam ganhos de eficiência. Cada geração de técnicas reduz a computação necessária para um determinado nível de qualidade.
Destilação: Treinar um modelo “aluno” mais pequeno para imitar um modelo “professor” maior pode alcançar 80–95% do desempenho do professor a 10–100× menor custo de treino e inferência.
Projeções: Para Onde se Dirigem os Custos de Treino (2026–2028)
O limite superior continua a subir. Dario Amodei da Anthropic afirmou que os modelos frontier poderiam custar $10 mil milhões para treinar até 2028. Se algum modelo individual custará realmente esse montante depende dos ganhos de eficiência e da economia dos retornos decrescentes.
O piso continua a cair. Ao mesmo tempo, o custo para treinar um modelo “equivalente ao GPT-4” continua a declinar — de $79M em 2023 para uns estimados $5–$10M em 2026 usando hardware de geração atual e técnicas de eficiência. O que era frontier-caro há dois anos torna-se alcançável para startups bem financiadas.
A implicação para a procura de GPU: Ambas as tendências sustentam a procura de GPU. Os laboratórios frontier precisam de mais GPUs para modelos maiores. Organizações mais pequenas precisam de GPUs para treinar o que era recentemente impossível. O mercado endereçável total para computação de treino expande-se em ambas as direções.
Para ver como os custos de inferência seguem um declínio semelhante mas ainda mais acentuado, consulte a nossa análise de economia de inferência. Para orientação de orçamentação específica para startups, consulte o nosso guia de computação para startups de AI.
Perguntas Frequentes
Quanto custa fazer fine-tuning de um modelo?
O fine-tuning é dramaticamente mais barato do que o pré-treino. Fazer fine-tuning de um modelo 7B custa aproximadamente $50–$500 num marketplace de GPU (algumas centenas de GPU-horas). Fazer fine-tuning de um modelo 70B custa $500–$5.000. Técnicas LoRA e QLoRA reduzem estes custos por mais 5–10×. O fine-tuning é acessível a virtualmente qualquer equipa com algumas centenas de dólares.
Porque é que o treino do GPT-4 é tão caro?
Escala. O GPT-4 terá sido treinado com 13 triliões de tokens usando 10.000+ GPUs A100 durante aproximadamente 100 dias. A preços de marketplace de A100 (~$1,00/hr), 10.000 GPUs durante 2.400 horas são $24 milhões apenas em computação — e os custos reais foram superiores devido a reinícios de treino, ajuste de hiperparâmetros e overhead de infraestrutura.
Posso treinar um modelo de AI útil por menos de $1.000?
Sim. Fazer fine-tuning de modelos open-source existentes (Llama 3, Mistral) com dados específicos de domínio pode ser feito por $50–$500. Treinar um modelo pequeno (1B–3B parâmetros) de raiz custa $1.000–$5.000. A chave é aproveitar modelos pré-treinados e técnicas eficientes como LoRA em vez de treinar de raiz.
Como é que o custo de treino afeta o mercado de AI?
Os custos elevados de treino criam barreiras à entrada — apenas organizações bem financiadas podem treinar modelos frontier. Isto concentra o poder entre poucos laboratórios (OpenAI, Anthropic, Google, Meta). No entanto, modelos open-source (Llama, Mistral, DeepSeek) e a queda dos custos de fine-tuning estão a democratizar o acesso a AI capaz. A barreira de custo de treino é alta para modelos frontier mas baixa para AI aplicada.
Os custos de treino vão continuar a subir?
O gasto total em treino frontier provavelmente continuará a subir (rumo a $1B+) porque os laboratórios pressionam por modelos maiores e mais capazes. Mas o custo para alcançar qualquer nível de desempenho dado está a cair rapidamente — o que custou $79M em 2023 custará menos de $10M até 2026. Ambas as afirmações são simultaneamente verdadeiras.
Como estimo os custos de treino para o meu projeto?
Regra prática: um modelo com N mil milhões de parâmetros treinado com T tokens requer aproximadamente (6 x N x T) FLOPs. Divida pela taxa de FLOP/s da GPU para obter GPU-horas. Multiplique pela tarifa horária. Exemplo: Um modelo 7B treinado com 1T tokens precisa de ~42 x 10^18 FLOPs. Uma H100 oferece ~990 TFLOPS (BF16). Isto são aproximadamente 11.800 GPU-horas, ou cerca de $17.700 a $1,50/hr no marketplace. Adicione 30–50% para overhead (reinícios, ajustes, avaliação).