A Escassez em 2026: O que Aconteceu e Porquê
A escassez de computação GPU que começou no final de 2022 não terminou. Evoluiu. Em 2026, o gargalo já não é a fabricação de chips GPU — a NVIDIA e a TSMC escalaram a produção significativamente. O gargalo moveu-se a montante para a memória: especificamente, High Bandwidth Memory (HBM), a DRAM especializada que cada acelerador de AI moderno requer.
A escassez é o resultado de uma colisão entre duas forças:
Procura explosiva de AI. Hyperscalers (Microsoft, Google, Amazon, Meta), programas de AI soberana e implementações empresariais estão coletivamente a encomendar milhões de aceleradores de AI por ano. Cada H100 requer 80GB de HBM3, e cada Blackwell B200 requer 192GB de HBM3e. A procura total de HBM cresceu 5× entre 2023 e 2026.
Oferta de memória restrita. A HBM é fabricada por apenas três empresas — SK Hynix, Samsung e Micron — usando processos especializados que não podem ser acelerados rapidamente. A produção de HBM requer 2–3× mais área de silício por gigabyte do que DRAM padrão, utiliza packaging avançado (empilhamento de dies com through-silicon vias) e tem rendimentos de fabrico mais baixos.
O resultado: o crescimento da procura ultrapassou em muito a expansão da oferta, criando uma escassez que os fabricantes de memória descrevem como a mais prolongada na história da indústria.
HBM: O Gargalo de Memória por Trás da Crise de GPU
O que Torna a HBM Diferente
A HBM não é memória comum. Fornece a largura de banda extrema que os aceleradores de AI precisam para alimentar dados a milhares de núcleos de computação. Compreender as diferenças técnicas explica porque a oferta não pode escalar facilmente:
| Característica | DRAM Padrão (DDR5) | HBM3 | HBM3e |
|---|---|---|---|
| Largura de banda | 38–51 GB/s por módulo | 819 GB/s por stack | 1.200 GB/s por stack |
| Estrutura | Die único | 8–12 dies empilhados | 8–12 dies empilhados |
| Packaging | Montagem PCB padrão | 2.5D/3D com interposer | 2.5D/3D com interposer |
| Área de die por GB | ~1× (referência) | ~2,5× | ~2,5× |
| Rendimento de fabrico | 85–95% | 60–75% | 55–70% |
| Preço por GB | ~$3 | ~$15–$20 | ~$20–$30 |
O gargalo principal: a HBM requer empilhar 8–12 dies individuais de DRAM uns sobre os outros usando through-silicon vias (TSVs), depois ligar o stack a um interposer ao lado do die da GPU. Cada etapa de empilhamento introduz perda de rendimento. Um único die defeituoso num stack de 12 dies sucata todo o stack.
A Diferença entre Oferta e Procura
A procura de HBM está a crescer aproximadamente 80–100% por ano impulsionada por implementações de aceleradores de AI. A oferta está a crescer a 50–60% por ano à medida que os fabricantes adicionam capacidade. A diferença está a estreitar-se mas não fechará totalmente até 2028–2029 aos ritmos de investimento atuais.
Como a Procura de AI Está a Canibalizar a Oferta de GPUs de Consumo
A escassez de HBM tem um impacto direto e visível na disponibilidade de GPUs de consumo. A NVIDIA terá cortado a produção da RTX série 50 (Blackwell consumo) em 30–40% na primeira metade de 2026 porque a mesma capacidade de fabrico de memória que produz GDDR7 para consumo também alimenta as linhas de produção de HBM.
O Problema da Alocação de Memória
Os fabricantes de memória enfrentam uma decisão de alocação de soma zero: cada wafer de silício DRAM pode ser usado para GDDR de consumo ou HBM de grau AI. A HBM comanda preços 5–10× mais altos por gigabyte e vem com contratos de longo prazo de clientes hyperscaler. A decisão de negócio é óbvia — priorizar HBM.
As consequências para consumidores e utilizadores de GPU não-AI:
- Preços mais altos de GPUs de consumo. Menos produção de GDDR significa custos de memória mais altos para GPUs gaming, o que se reflete nos preços de retalho
- Disponibilidade limitada. As placas RTX série 50 continuam difíceis de comprar ao MSRP, com preços de rua 20–40% acima do MSRP
- Ciclos de produto mais longos. A NVIDIA tem menos incentivo para renovar as linhas de GPU de consumo quando os aceleradores de AI geram margens mais altas por chip
Para uma análise mais aprofundada de como os modelos de GPU se comparam em cargas de trabalho de AI e porque isto importa para a seleção de hardware, consulte a nossa visão geral de GPU.
A Resposta da Cadeia de Fornecimento: $50B+ em Investimento em Novas Fábricas
Os fabricantes de memória estão a responder com o maior investimento de capital na história da DRAM. O investimento total comprometido entre os três fornecedores de HBM ultrapassa $50 mil milhões.
| Fabricante | Quota de Mercado HBM (2026) | Investimento Anunciado | Cronograma de Nova Capacidade |
|---|---|---|---|
| SK Hynix | ~53% | $18B+ (novas fábricas na Coreia, EUA) | H2 2027 – H1 2028 |
| Samsung | ~35% | $17B+ (expansão na Coreia, Texas) | H1 2028 |
| Micron | ~12% | $15B+ (nova fábrica no Idaho, expansão no Japão) | H2 2027 – 2028 |
Porque Demora Tanto Tempo
Uma nova fábrica de semicondutores requer 18–24 meses para construir e equipar, seguidos de 6–12 meses para qualificar a produção — o que significa que investimentos feitos em 2026 não produzirão HBM em volume até 2028 no mínimo.
A produção de HBM especificamente requer:
- Linhas de packaging avançado para empilhamento de dies (separadas da fábrica de wafers)
- Equipamento de through-silicon via (TSV) que está ele próprio em escassez
- Infraestrutura de testes e qualidade (cada stack de HBM passa por testes exaustivos)
- Técnicos formados para processos que não são totalmente automatizados
O investimento está a acontecer, mas os prazos medem-se em anos, não em trimestres.
Impacto nos Preços de GPU: Tarifas de Marketplace e Cloud
A escassez de HBM afeta diretamente o que paga por computação GPU — quer esteja a comprar hardware, alugar instâncias cloud ou a usar marketplaces de GPU.
Preços de Hardware
Os preços de H100 no mercado secundário estabilizaram em vez de descer, apesar de GPUs Blackwell estarem disponíveis. Num ciclo normal de GPU, hardware de geração anterior cai 30–50% quando uma nova geração é lançada. A H100 desafiou este padrão porque:
- A escassez de HBM limita a produção de Blackwell, mantendo a procura de H100 elevada
- O hardware H100 com HBM3 é comprovado e implementável imediatamente
- A oferta de H100 usadas é limitada porque os operadores não têm razão para vender hardware que gera receita 24/7
Para a dinâmica e preços atuais do mercado secundário, consulte o nosso guia de compra e venda de GPUs.
Tarifas de Cloud e Marketplace
| GPU | Tarifa Esperada (sem escassez) | Tarifa Real (2026) | Prémio |
|---|---|---|---|
| H100 80GB (cloud) | $2,00–$3,00/hr | $2,50–$4,00/hr | +25–33% |
| H100 80GB (marketplace) | $1,00–$1,50/hr | $1,30–$2,00/hr | +30% |
| A100 80GB (marketplace) | $0,50–$0,80/hr | $0,70–$1,20/hr | +40% |
| B200 (cloud) | $3,50–$5,00/hr | $4,50–$7,00/hr | +30–40% |
Os preços de marketplace mantêm um prémio de 25–40% sobre o que seria esperado com base apenas nas curvas de depreciação do hardware. A escassez efetivamente estende o período de receita elevada para operadores de GPU. Para preços completos entre fornecedores, consulte a nossa comparação de preços de GPU cloud.
Cronograma: Quando é que a Oferta Vai Recuperar?
Com base nos investimentos em fábricas anunciados e os seus cronogramas de construção:
Final de 2027: A primeira nova capacidade significativa de HBM entra em funcionamento a partir das expansões da SK Hynix e Micron. Isto alivia a escassez aguda mas não fecha a diferença totalmente.
2028: As fábricas da Samsung e adicionais da SK Hynix alcançam produção em volume. O crescimento da oferta de HBM acelera para corresponder ao crescimento da procura. A disponibilidade de GDDR de consumo melhora.
2028–2029: Oferta e procura alcançam equilíbrio aproximado. Os preços de GPU começam a seguir curvas de depreciação normais. Hardware de geração anterior começa a declinar como esperado.
Fator imprevisível — requisitos de memória de GPUs de próxima geração: A arquitetura Rubin da NVIDIA (esperada para 2027–2028) pode requerer ainda mais HBM por GPU (256GB+), potencialmente prolongando a escassez se o crescimento da procura reacelerar.
Ponto-chave: A escassez não é permanente, mas vai persistir por mais 2–3 anos. Os operadores de GPU que asseguraram hardware antes do pior da escassez beneficiam de tarifas de aluguer elevadas durante o período. Os novos entrantes enfrentam custos de aquisição de hardware mais altos mas podem igualmente beneficiar dos mesmos prémios de tarifa. Para a perspetiva de investimento sobre retornos de GPU impulsionados pela escassez, consulte a nossa análise GPU como classe de ativos.
O que Compradores e Locatários de GPU Devem Fazer Agora
Se Está a Comprar GPUs
Compre hardware de geração atual agora se tiver procura. Esperar que os preços desçam pode custar mais em receita de aluguer perdida do que as poupanças em hardware. Às tarifas atuais de marketplace, o hardware H100 paga-se em 18–24 meses — bem dentro da janela de escassez.
Considere A100 usadas para inferência. GPUs A100 80GB a preços usados atuais ($8.000–$12.000) oferecem excelente custo por token de inferência e estão mais disponíveis do que H100. Para uma comparação detalhada entre gerações de GPU, consulte o nosso guia NVIDIA vs AMD.
Assegure hardware equipado com HBM quando disponível. Não espere pelo “momento perfeito para comprar” — durante uma escassez, a disponibilidade importa mais do que a otimização de preço.
Se Está a Alugar Computação GPU
Fixe tarifas reservadas se a sua carga de trabalho é previsível. Durante escassez, os preços spot são voláteis e tendem a subir. Instâncias reservadas a tarifas fixas proporcionam certeza de custo.
Use marketplaces de GPU para poupanças. As tarifas de marketplace são tipicamente 40–60% mais baixas do que as tarifas de hyperscalers mesmo durante a escassez. O prémio sobre preços fora de escassez é menor nos marketplaces do que nas grandes clouds.
Considere hardware otimizado para inferência. GPUs L40S e L4 são menos afetadas pela escassez de HBM (usam menos HBM ou GDDR padrão) e oferecem desempenho de inferência competitivo. Diversificar para além de cargas de trabalho exclusivamente H100 reduz a sua exposição a preços impulsionados por HBM.
Para um framework de decisão completo sobre comprar, fazer leasing ou alugar computação GPU, consulte o nosso guia de financiamento de GPU. Para as restrições energéticas que se combinam com a escassez de chips, consulte a nossa análise de energia de centros de dados.
Perguntas Frequentes
O que é HBM e porque importa para as GPUs?
HBM (High Bandwidth Memory) é um tipo especializado de DRAM que fornece 10–30× mais largura de banda do que memória DDR5 padrão. Aceleradores de AI como a H100 e B200 requerem esta largura de banda extrema para alimentar dados aos seus núcleos de computação suficientemente rápido. Sem HBM, estas GPUs operariam a uma fração da sua capacidade. A HBM é o componente com maior restrição de oferta na cadeia de fornecimento de hardware de AI.
Porque é que ainda há escassez de GPU em 2026?
A escassez mudou da fabricação de chips GPU (que a NVIDIA e a TSMC escalaram) para a memória HBM. A procura de HBM está a crescer 80–100% anualmente enquanto a oferta cresce 50–60%. Apenas três fabricantes (SK Hynix, Samsung, Micron) produzem HBM, e expandir a produção requer construção de novas fábricas que leva 18–24 meses.
Como é que a escassez afeta os preços de marketplaces de GPU?
As tarifas de aluguer de GPU em marketplaces são 25–40% mais altas do que seriam sem a escassez. Os preços spot de H100 estabilizaram em vez de descer com o lançamento da Blackwell, e as tarifas de A100 permanecem elevadas à medida que as empresas de AI as usam para cargas de inferência. A escassez estende o período de receita elevada para operadores de GPU.
Quando é que os preços de GPU vão descer?
Um alívio significativo de preços é esperado para final de 2027 a 2028 à medida que nova capacidade de produção de HBM entre em funcionamento. No entanto, se as GPUs de próxima geração (arquitetura Rubin) requererem ainda mais memória por chip, a escassez pode prolongar-se mais. Planear para preços estáveis a elevados pelo menos até 2027 é prudente.
Devo esperar para comprar hardware GPU até os preços descerem?
Para operadores com procura imediata geradora de receita, esperar é tipicamente mais caro do que comprar agora. A receita de aluguer ganha durante o período de espera frequentemente excede as potenciais poupanças em hardware. Para aqueles sem procura imediata, esperar pela normalização da oferta em 2028 pode render 20–30% de poupanças nos custos de hardware.