A NVIDIA divulgou em 16 de setembro de 2026 os resultados de sua participação na rodada MLPerf Inference v6.1. A empresa estreou o sistema Vera Rubin NVL72 em uma submissão de prévia.
Segundo a NVIDIA, a nova plataforma entrega até 3,7 vezes mais vazão que o GB300 NVL72, seu antecessor direto na família de racks com 72 GPUs interligadas. Os números recolocam a economia da inferência no centro da disputa entre fornecedores de hardware para inteligência artificial.
A pergunta que importa é quantos tokens é possível gerar por real investido em infraestrutura.
Vera rubin nvl72 na estreia
A submissão de prévia cobriu dois dos benchmarks mais exigentes da suíte: DeepSeek-R1 e Qwen3-VL.
No caso do Qwen3-VL, o ganho de até 3,7x sobre o GB300 NVL72 aparece nos três cenários medidos: offline, servidor e interativo. O modelo rodou sobre vLLM e o framework open source de inferência NVIDIA Dynamo.
Já no DeepSeek-R1, com a biblioteca TensorRT-LLM, a vazão chega a ser 2,5 vezes maior que a do GB300 NVL72.
Os resultados da plataforma NVIDIA vêm das entradas 6.1-0106 e 6.1-0074, recuperadas do site da MLCommons em 16 de setembro de 2026.
Na prática, cada rack Vera Rubin NVL72 gera mais tokens, atende mais usuários e produz mais receita que um rack GB300 NVL72, com custo por token menor.
A empresa credita o desempenho ao co-design de hardware e software. Os Tensor Cores e o Transformer Engine da geração Vera Rubin aceleram as fases de prefill e decode da inferência.
A precisão NVFP4 reduz o consumo de memória em pesos, atenção e KV cache, elevando a vazão com perda mínima de qualidade na saída.
Escala com eficiência
Eficiência de escala é a medida de quanto cada GPU adicional se converte em vazão real.
A submissão de DeepSeek-R1 da NVIDIA saiu de um único rack GB300 NVL72, com 72 GPUs, para quatro racks, totalizando 288 GPUs. Atingiu 99% de eficiência de escala no cenário offline, com a vazão crescendo de forma quase proporcional ao hardware acrescentado.
Esses resultados estão nas entradas 6.1-0073 e 6.1-0074.
O dado importa porque dobrar a contagem de GPUs não garante dobrar o desempenho. Se o acréscimo de aceleradores rendesse apenas um ganho percentual de um dígito, o custo da infraestrutura cresceria muito além do retorno em performance.
Para que a escala funcione, arquitetura, interconexão e software precisam avançar juntos. É aí que entram os interconnects de alta largura de banda dentro do rack, a rede de alta velocidade entre racks e a orquestração eficiente de requisições entre nós.
Otimização contínua de software
A NVIDIA afirma que as otimizações de software incluídas nas submissões do MLPerf Inference v6.1 entregaram até 1,6x mais desempenho em relação à rodada v6.0.
Segundo a empresa, o trabalho de otimização continuou depois do envio dos resultados e seguiu gerando ganhos adicionais. É um argumento para quem precisa justificar o investimento em infraestrutura já instalada.
A submissão do Vera Rubin também fez uso intenso de serving desagregado, que separa prefill e decode. Combinou isso com paralelismo de especialistas em larga escala para distribuir a carga pelas camadas de mixture-of-experts que sustentam modelos como DeepSeek-R1 e Qwen3-VL.
Essas técnicas só funcionam em escala de rack graças ao domínio de scale-up NVL72, baseado no NVLink de sexta geração e no NVLink Switch. Segundo o material divulgado, o sistema entrega taxas de pacotes até 10x maiores e latência 3x menor que Ethernet de prateleira.
Agentes mudam a régua dos benchmarks
Agentes de IA, que raciocinam, planejam e agem em múltiplas etapas, estão redesenhando a forma de medir desempenho de inferência.
Em testes desenhados para capturar essa mudança, como o SemiAnalysis AgentX, o Vera Rubin NVL72 apresentou desempenho 30 vezes superior ao GB300 NVL72 na avaliação de prévia.
A NVIDIA também antecipa que o futuro benchmark MLPerf Endpoints deve trazer medição padronizada para cargas agênticas, indo além do que os testes tradicionais de vazão conseguem captar.
O ecossistema de parceiros acompanha o movimento. A Nebius também submeteu resultados de prévia do Vera Rubin NVL72 e apresentou bom desempenho na mesma rodada.
Por que isso importa
Por trás de desempenho, eficiência de escala e velocidade de software existe um conceito que a NVIDIA chama de fungibilidade de plataforma. A mesma infraestrutura roda qualquer modelo e qualquer carga, do treinamento à inferência, de sistemas de recomendação ao raciocínio, de linguagem a vídeo, mantendo a utilização alta.
Para organizações que decidem onde colocar seus recursos de IA, três fatores definem a economia de inferência no longo prazo: vazão, escala e ritmo de otimização.







