Preços de GPU Cloud: O Panorama Completo
A taxa horária anunciada de uma GPU cloud não é o que realmente paga. Os custos reais de GPU cloud incluem taxas ocultas, penalidades de granularidade de faturação e overhead de infraestrutura que podem inflacionar a sua fatura em 20–40% além do preço de capa.
Este guia foca-se no que outras comparações de preços falham: o custo total de executar uma carga de trabalho GPU, não apenas o preço de etiqueta. Comparamos três tipos de fornecedores, expomos custos ocultos e fornecemos cinco estratégias concretas para reduzir o seu gasto com GPU.
Para comparações de especificações de GPU e recomendações de cargas de trabalho, consulte o nosso guia de melhor GPU para IA. Este artigo foca-se em fornecedores e preços — onde aluga, não o que aluga.
Três Tipos de Fornecedores de GPU Cloud
O mercado de GPU cloud tem três níveis distintos, cada um com estruturas de preços, compensações e clientes-alvo diferentes.
Hyperscalers (AWS, Google Cloud, Azure)
Os principais fornecedores cloud oferecem instâncias GPU como parte da sua ampla plataforma de infraestrutura. Obtém SLAs empresariais, regiões globais, integração profunda com serviços geridos (armazenamento, plataformas ML, monitorização) e disponibilidade garantida para instâncias reservadas.
O prémio: $3,00–$6,98/hr para uma H100 on-demand. Instâncias reservadas (compromissos de 1–3 anos) reduzem isto em 30–50%, mas requerem lock-in a longo prazo.
Clouds GPU Especializadas (Lambda, CoreWeave)
Focadas exclusivamente em infraestrutura GPU. Estes fornecedores oferecem preços competitivos ($2,00–$3,00/hr para H100), configurações otimizadas para cargas de trabalho IA e suporte focado em IA — mas menos serviços geridos que hyperscalers.
Marketplaces GPU (GPUnex, Vast.ai, RunPod)
Agregam capacidade GPU de centenas de data centers distribuídos. Ao reunir oferta de muitos fornecedores, os marketplaces oferecem os preços mais competitivos ($1,49–$2,50/hr para H100) com faturação flexível — frequentemente ao segundo em vez de à hora. As compensações incluem fiabilidade variável e ferramentas menos integradas.
Comparação de Preços por Modelo de GPU
Aqui está o que cada GPU realmente custa em diferentes tipos de fornecedor no início de 2026:
| Modelo GPU | Hyperscaler On-Demand | Hyperscaler Reservado | Cloud Especializada | Marketplace GPU |
|---|---|---|---|---|
| H100 80GB | $3,00–$6,98/hr | $2,00–$4,50/hr | $2,00–$3,00/hr | $1,49–$2,50/hr |
| A100 80GB | $1,50–$3,50/hr | $1,00–$2,50/hr | $0,80–$1,50/hr | $0,72–$1,50/hr |
| L40S 48GB | $1,20–$2,50/hr | $0,80–$1,80/hr | $0,80–$1,50/hr | $0,60–$1,20/hr |
| L4 24GB | $0,50–$1,00/hr | $0,30–$0,70/hr | $0,30–$0,60/hr | $0,20–$0,50/hr |
| RTX 4090 24GB | N/A (não oferecida) | N/A | $0,40–$0,80/hr | $0,40–$0,80/hr |
Observação chave: A diferença de preço entre hyperscaler on-demand e preço de marketplace é de 2–4,7x para o mesmo hardware GPU. Para uma H100, a diferença entre $6,98/hr (AWS on-demand) e $1,49/hr (spot em marketplace) é de $5,49/hr — que se acumula para $4.008/mês para uma única GPU a funcionar 24/7.
Custos Ocultos Que Inflacionam a Sua Fatura de GPU
A taxa horária de GPU é apenas parte da história. Cinco categorias de custos ocultos surpreendem regularmente as equipas:
1. Taxas de Egress de Dados
Mover dados para fora da rede de um fornecedor cloud custa dinheiro — tipicamente $0,05–$0,12 por GB. Treinar um modelo que descarrega 1 TB de dados de treino e exporta checkpoints regularmente pode adicionar $50–$120 em taxas de egress por sessão de treino. Workflows multi-cloud (treino num fornecedor, inferência noutro) multiplicam estes custos.
2. Custos de Armazenamento
As instâncias GPU precisam de espaço em disco para datasets, checkpoints de modelo e logs. O armazenamento cloud custa $0,02–$0,08/GB/mês. Um dataset de 5 TB armazenado durante 3 meses custa $300–$1.200 — invisível na taxa horária da GPU mas muito visível na fatura.
3. Rede e Balanceamento de Carga
A inferência em produção requer balanceadores de carga, API gateways e rede inter-nó. Estes serviços adicionam $50–$200+/mês dependendo do volume de tráfego. Clusters de treino multi-GPU incorrem em custos adicionais para rede inter-nó de alta velocidade.
4. Compromissos Mínimos e Arredondamento
Alguns fornecedores faturam em incrementos horários — um trabalho de 35 minutos custa o mesmo que um de 60 minutos. A faturação ao segundo (oferecida por alguns marketplaces) elimina este desperdício. Para cargas de trabalho intermitentes com muitos trabalhos curtos, a faturação à hora pode desperdiçar 15–30% do seu gasto em tempo não utilizado.
5. Taxas de Serviços API e Gestão
Serviços ML geridos (SageMaker, Vertex AI) cobram taxas adicionais além da computação GPU. Estas podem adicionar 10–30% ao custo base da GPU pela conveniência de pipelines de treino e deployment geridos.
Insight chave: Uma carga de trabalho que custa $3,15/hr em computação GPU pode custar $4,00–$4,50/hr no total quando adiciona egress, armazenamento, rede e taxas de gestão. Calcule sempre o custo total da sua carga de trabalho, não apenas a linha de GPU.
Como Reduzir Custos de GPU Cloud em 40%
Cinco estratégias comprovadas que, combinadas, podem reduzir o seu gasto total com GPU em 30–40%:
1. Use Instâncias Spot/Preemptíveis (Poupe 15–20%)
Instâncias spot oferecem descontos de 40–60% sobre preços on-demand. A contrapartida: podem ser interrompidas com aviso curto (tipicamente 2 minutos a 2 horas). Para cargas de trabalho tolerantes a falhas — treino com checkpointing, processamento de dados em lote, inferência não urgente — as instâncias spot são a maior alavanca de custo individual.
Funciona melhor para: Treino de modelo com checkpoints regulares, pré-processamento de dados, inferência em lote, experimentação.
Não funciona para: Inferência em produção servindo utilizadores em tempo real, trabalhos com prazo crítico, cargas de trabalho que não toleram interrupção.
2. Faça Right-Size da Sua GPU (Poupe 8–12%)
Muitas equipas usam por defeito a GPU mais poderosa “por segurança.” Uma carga de trabalho que funciona bem numa A100 ($0,72/hr) não precisa de uma H100 ($3,15/hr). O nosso guia de melhor GPU para IA fornece um framework de decisão por carga de trabalho — adequar o modelo de GPU à tarefa pode reduzir custos em 50%+ para cargas de trabalho sobre-aprovisionadas.
Erros comuns: Usar H100 para inferência quando L40S é suficiente. Usar A100 para fine-tuning de modelos pequenos quando RTX 4090 funciona. Executar inferência em lote em instâncias on-demand quando spot está disponível.
3. Agende e Auto-Escale (Poupe 5–8%)
Instâncias GPU a funcionar 24/7 quando a sua equipa trabalha 8 horas/dia desperdiçam dois terços do gasto. Políticas de auto-escalonamento que iniciam GPUs para trabalhos de treino e as terminam quando inativas podem recuperar desperdício significativo. Mesmo agendamento simples — “GPUs ligadas às 8h, desligadas às 20h” — poupa 50% em instâncias de desenvolvimento.
4. Migre Cargas de Trabalho para Marketplaces (Poupe 10–15%)
Para cargas de trabalho que não requerem serviços geridos específicos de hyperscaler, mudar para um marketplace de GPU pode poupar 3–6x em computação. O requisito chave: a sua carga de trabalho deve estar containerizada (Docker) e não dependente de APIs específicas do fornecedor (SageMaker, Vertex AI).
5. Use Capacidade Reservada/Comprometida (Poupe 5–10% adicional)
Para cargas de trabalho previsíveis e sustentadas (inferência em produção, treino contínuo), compromissos de capacidade reservada oferecem descontos de 30–50% sobre preços on-demand. A contrapartida é o compromisso — tipicamente 1–3 anos. Combine capacidade reservada para a sua base com spot/marketplace para carga variável.
Detalhamento por Fornecedor
AWS (Amazon Web Services)
Instâncias GPU: P5 (H100), P4 (A100), G5 (A10G), G6 (L4). Preços: H100 on-demand: ~$4,50–$6,98/hr. Reservada (1 ano): ~$3,00–$4,50/hr. Spot: ~$1,50–$2,50/hr. Pontos fortes: Ecossistema de serviços geridos mais amplo (SageMaker, EKS, S3), disponibilidade global, suporte empresarial. Atenção: Taxas de egress ($0,09/GB), níveis de preços complexos, flutuações de disponibilidade de instâncias on-demand.
Google Cloud Platform
Instâncias GPU: A3 (H100), A2 (A100), G2 (L4). Preços: H100 on-demand: ~$3,50–$5,50/hr. Comprometida (1 ano): ~$2,50–$3,50/hr. Spot: ~$1,50–$2,00/hr. Pontos fortes: Alternativa TPU forte, excelente integração JAX/TensorFlow, plataforma gerida Vertex AI, preços spot competitivos. Atenção: Frota GPU menor que AWS, menos disponibilidade em algumas regiões.
Microsoft Azure
Instâncias GPU: ND H100 (H100), NC A100 (A100), NC T4 (T4). Preços: H100 on-demand: ~$3,00–$5,00/hr. Reservada (1 ano): ~$2,00–$3,50/hr. Pontos fortes: Integração OpenAI (Azure OpenAI Service), forte identidade/segurança empresarial, capacidades de cloud híbrida. Atenção: A disponibilidade de GPU pode ser restrita em regiões populares.
Marketplaces GPU
GPUs disponíveis: H100, A100, L40S, L4, RTX 4090 e mais. Preços: H100: $1,49–$2,50/hr. A100: $0,72–$1,50/hr. RTX 4090: $0,40–$0,80/hr. Pontos fortes: Preços mais baixos, faturação flexível (ao segundo em algumas plataformas), sem compromissos, ampla seleção de GPU incluindo placas de consumo. Atenção: Fiabilidade variável dependendo do fornecedor, menos ferramentas geridas, pode requerer mais configuração self-service.
Quando Usar Qual Tipo de Fornecedor
| Cenário | Melhor Tipo de Fornecedor | Porquê |
|---|---|---|
| Inferência empresarial em produção | Hyperscaler | SLAs, disponibilidade global, serviços geridos |
| Treino em grande escala (1000+ GPUs) | Hyperscaler ou Cloud Especializada | Capacidade garantida, rede NVLink |
| Treino otimizado em custo | Marketplace GPU (spot) | Preços mais baixos, checkpointing lida com interrupções |
| Desenvolvimento e experimentação | Marketplace GPU | Faturação ao segundo, sem compromissos, iteração barata |
| Equipa pequena / startup | Marketplace GPU | Menor barreira, escalonamento flexível, sem mínimos |
| Inferência em lote | Marketplace GPU ou Spot | Tolera interrupção, sensível ao preço |
| Cargas de trabalho reguladas (finanças, saúde) | Hyperscaler | Certificações de conformidade, trilhos de auditoria |
Para a questão alugar-vs-comprar — se o aluguer cloud faz mais sentido do que possuir hardware — consulte a nossa comparação detalhada de custos. Para startups a orçamentar o seu primeiro gasto com GPU, consulte o nosso guia de custos de computação para startups IA.
Perguntas Frequentes
Qual é a forma mais barata de alugar uma H100?
Os marketplaces de GPU oferecem as taxas H100 mais baixas a $1,49–$2,50/hr. Instâncias spot de hyperscaler vêm a seguir a $1,50–$2,50/hr mas podem ser interrompidas. A opção fiável mais barata é um marketplace com um fornecedor que tenha pontuações de uptime elevadas. Para cargas de trabalho não críticas em tempo, o preço spot em qualquer plataforma oferece os maiores descontos.
Os custos ocultos são realmente assim tão significativos?
Sim. Para uma carga de trabalho de treino típica, os custos ocultos (egress, armazenamento, rede) adicionam 20–40% à fatura de computação GPU. Uma instância H100 a $3,15/hr executando um trabalho de treino com 2 TB de transferência de dados e 500 GB de armazenamento de checkpoints pode efetivamente custar $4,00–$4,50/hr no total. Estime sempre o custo total da carga de trabalho, não apenas a taxa por hora da GPU.
Devo usar um fornecedor ou múltiplos?
Múltiplos. Use marketplaces GPU para cargas de trabalho sensíveis ao custo (desenvolvimento, processamento em lote, inferência). Use hyperscalers para inferência em produção e cargas de trabalho reguladas. Use preços spot em todos os fornecedores para trabalhos tolerantes a falhas. Diversificar previne lock-in e permite otimizar custos em cada nível.
O que é faturação ao segundo e importa?
A faturação ao segundo cobra apenas pelo tempo exato em que a sua GPU está ativa. A faturação à hora arredonda para cima — um trabalho de 35 minutos custa o mesmo que 60 minutos. Para cargas de trabalho com muitos trabalhos curtos (inferência, experimentação, CI/CD), a faturação ao segundo poupa 15–30%. Para trabalhos de treino longos, a diferença é negligível.
Como mudaram os preços de GPU ao longo do último ano?
Os preços da H100 caíram 44% entre junho de 2024 e junho de 2025, impulsionados pela expansão da oferta e concorrência de marketplace. Os preços da A100 caíram ainda mais à medida que a GPU envelhece. Espera-se que os preços continuem a declinar gradualmente à medida que a NVIDIA e AMD aumentam a produção, embora GPUs de nova geração (B200, Rubin) comandarão preços premium no lançamento. Para contexto de mercado mais amplo, consulte a nossa análise de mercado OpenAI-NVIDIA.