A NVIDIA detalhou em 1º de outubro de 2026, em publicação no seu blog corporativo, a lógica econômica por trás das chamadas fábricas de IA, infraestruturas construídas na casa do megawatt e, às vezes, do gigawatt. Segundo a empresa, cada megawatt de capacidade instalada custa aproximadamente US$ 60 milhões.
Operadores só assumem compromissos desse porte quando enxergam com clareza o retorno sobre o investimento.
De acordo com o material, três variáveis moldam esse retorno. A primeira é a capacidade de geração de receita: quanto a fábrica poderia faturar em um ano se vendesse todos os tokens que consegue produzir.
A segunda é a vida útil, que mede por quanto tempo o hardware continua gerando dinheiro. A terceira é a demanda, ou seja, quanto mercado existe para esses tokens.
O tripé do retorno
A NVIDIA argumenta que nenhuma dessas três dimensões compensa totalmente a fraqueza das outras. Uma capacidade elevada de produção vale pouco se a fábrica vende apenas parte do que é capaz de gerar.
Demanda alta perde relevância se a operação deixa de produzir em capacidade máxima em apenas um ano. Os fatores são interdependentes: um parque que roda mais tipos de carga encontra mais demanda e segue faturando ano após ano.
Para a empresa, suas fábricas de IA são projetadas para maximizar as três frentes ao mesmo tempo. Elas seriam produtivas, por entregarem o maior throughput por megawatt e o menor custo por token.
Seriam duráveis, porque as GPUs e os sistemas continuam gerando receita anos depois do envio. E fungíveis, por rodarem todo tipo de IA, em qualquer fase e em qualquer lugar, além de cargas que não envolvem IA.
A conta dos tokens por megawatt
Segundo a NVIDIA, a energia é a restrição que define uma fábrica de IA. Por isso, a métrica que governa a capacidade de geração de receita é o número de tokens por segundo por megawatt.
Mais tokens dentro de um mesmo envelope de potência significam mais receita, e um custo menor por token amplia a margem.
O texto cita dados da análise AgentX, da SemiAnalysis. Segundo esses dados, os sistemas Vera Rubin NVL72 entregam mais de 30 vezes o throughput por megawatt do GB300 NVL72, além de um custo até 45 vezes menor por milhão de tokens no modelo DeepSeek V4 Pro.
A publicação também menciona uma análise da SemiAnalysis sobre o desempenho do GB300 NVL72 no modelo GLM 5.3. Ganhos desse tamanho viriam do codesign extremo em toda a pilha, com otimização conjunta de modelos, cargas de trabalho, software, computação, rede e memória, como descrito no material sobre eficiência para agentes de IA.
A NVIDIA coloca ainda uma questão que costuma surgir quando cada geração fica muito mais barata: se o token fica mais barato, a demanda por computação encolhe? A resposta apresentada é que tokens mais baratos viabilizam novos casos de uso, e esses casos consomem mais tokens do que a eficiência economizou.
Durabilidade: o parque instalado continua faturando
Nem toda carga de trabalho exige o sistema mais recente. O ajuste ideal depende da complexidade e do formato da tarefa, o que explica por que a geração anterior continua sendo economicamente relevante depois da chegada da seguinte.
A GPU A100, lançada em 2020, seguia em serviço comercial seis anos depois. A CoreWeave chegou a estender reservas de unidades apresentadas em 2020 até 2029.
Operadores de grande porte vêm ampliando os prazos de depreciação de seus servidores. Isso funciona como uma aposta sobre quando o hardware deixa de gerar receita, e essa aposta segue se deslocando para frente.
Uma análise da Sprout publicada em setembro de 2026, intitulada "The Productive Life of a Data Center GPU", acompanha essa mudança entre os principais operadores. O documento lembra que a vida contábil é uma proxy conservadora da vida física: a frota de V100 da Microsoft operou 8,4 anos, contra uma vida contábil de seis.
Outros dados de mercado reforçam o argumento. A Barkr estima vida útil de cinco a seis anos para um sistema H100 de oito GPUs e de nove a dez anos para o GB300 NVL72, com base nos preços de revenda.
A Silicon Data mostra que uma A100 de seis anos ainda vale um quarto do que custou, enquanto um cronograma de depreciação de cinco anos já a teria zerado há mais de um ano. Já a Ornn Data aponta que o mercado paga 80% do valor para alugar uma A100 em contrato de cinco anos em comparação a um contrato de um mês.
Fungibilidade e demanda
Parte dessa durabilidade vem do software. A CUDA, plataforma de programação das GPUs NVIDIA, atravessa gerações e evita que o que o operador já possui fique ocioso quando uma nova arquitetura chega.
Otimizações contínuas de software e de kernels ampliam o que o hardware instalado consegue fazer. As bibliotecas CUDA-X permitem rodar qualquer carga acelerada.
Uma arquitetura padronizada, diz a empresa, coloca tudo isso ao alcance de qualquer operador, a partir de um design de referência validado.
A mesma plataforma atende aprendizado de máquina, aprendizado profundo, IA generativa, raciocínio, IA agêntica e IA física. Cada nova modalidade chegou sobre hardware que já estava instalado.
É essa fungibilidade que sustenta a demanda: quanto mais tipos de trabalho um sistema aceita, mais tempo ele encontra trabalho para fazer. Para quem decide compras de infraestrutura, a mensagem central do material é que o cálculo relevante não é apenas o pico de desempenho da geração mais nova.
O que importa é a combinação entre custo por token, vida econômica do parque instalado e diversidade de cargas que ele é capaz de absorver.
Fontes e links
- NVIDIA
- Análise AgentX da SemiAnalysis sobre Vera Rubin NVL72
- Sprout: The Productive Life of a Data Center GPU
- Ornn Data: The Economics of Open-Weight Inference







