NVIDIA Vera Rubin NVL72 Estreia no MLPerf Inference v6.1 com Performance de Destaque

Na estreia no MLPerf Inference v6.1, o Vera Rubin NVL72 entregou até 3,7x mais vazão que o GB300 NVL72, com vLLM e o NVIDIA Dynamo.
por

Performance de sistema, escalabilidade eficiente de infraestrutura e otimização contínua de software são as alavancas que determinam a economia da inferência de IA. Mais performance de sistema significa mais tokens gerados e, portanto, mais receita. Escalar de forma eficiente significa que a vazão cresce proporcionalmente conforme o hardware é adicionado, exigindo menos recursos para atender usuários em escala. Otimização contínua significa extrair mais valor dos investimentos em infraestrutura.

Por trás das três está a fungibilidade da plataforma: a mesma infraestrutura roda qualquer modelo e qualquer carga de trabalho, de treinamento a inferência, de recomendação a raciocínio, de linguagem a vídeo, mantendo a utilização alta.

A plataforma NVIDIA foi construída para otimizar todos esses pontos, como mostram os resultados do MLPerf Inference v6.1 divulgados hoje:

  • O sistema NVIDIA Vera Rubin NVL72 estreia com performance de destaque: na primeira submissão em preview ao MLPerf Inference, o NVIDIA Vera Rubin NVL72 entrega até 3,7x mais vazão que o GB300 NVL72.
  • O NVIDIA GB300 NVL72 escala com alta eficiência: uma submissão com 288 GPUs em quatro racks GB300 NVL72 atingiu 99% de eficiência de escalabilidade, com a vazão crescendo de forma quase linear em relação à base de um rack.
  • Otimizações contínuas de software geram ganhos de performance: as otimizações de software nas submissões da NVIDIA ao MLPerf Inference v6.1 entregaram até 1,6x mais performance que a v6.0. As otimizações continuaram depois da submissão da v6.1, com ganhos adicionais.

Para organizações que estão decidindo sobre infraestrutura de IA, performance, eficiência de escalabilidade e velocidade de software são considerações importantes, porque determinam a economia da inferência no longo prazo.

O Vera Rubin NVL72 estreia no MLPerf Inference com performance de destaque

A NVIDIA submeteu resultados em preview do Vera Rubin NVL72 em dois dos benchmarks mais exigentes da suíte MLPerf Inference v6.1: DeepSeek-R1 e Qwen3-VL.

O Vera Rubin NVL72 entrega até 3,7x mais vazão que o GB300 NVL72 no Qwen3-VL nos cenários offline, server e interactive, usando vLLM com o framework de inferência open source NVIDIA Dynamo. No DeepSeek-R1, com a biblioteca NVIDIA TensorRT-LLM, a vazão é até 2,5x maior que a do GB300 NVL72. Esses resultados iniciais mostram o ritmo de inovação da NVIDIA e como a performance deve melhorar com otimizações contínuas de software.

Gráfico comparando a vazão do NVIDIA Vera Rubin NVL72 com o do GB300 NVL72
MLPerf Inference v6.1, Closed Division. Resultados obtidos em www.mlcommons.org em 16 de setembro de 2026. Resultados da plataforma NVIDIA referentes às seguintes entradas: 6.1-0106 e 6.1-0074. O nome e o logotipo MLPerf são marcas registradas e não registradas da MLCommons Association nos Estados Unidos e em outros países. Todos os direitos reservados. O uso não autorizado é estritamente proibido. Veja www.mlcommons.org para mais informações.

Na prática, cada rack Vera Rubin NVL72 entrega bem mais tokens, atende mais usuários e gera mais receita que um rack GB300 NVL72, reduzindo o custo por token.

Os resultados refletem codesign full-stack entre hardware e software. Os Tensor Cores e o Transformer Engine aprimorados do Vera Rubin aceleram tanto a fase de prefill quanto a de decode da inferência, enquanto a precisão NVFP4 reduz o consumo de memória em pesos do modelo, attention e KV cache, aumentando a vazão com perda mínima de qualidade na saída.

As submissões do Vera Rubin usaram bastante serving desagregado, separando prefill e decode, junto com paralelismo de especialistas em larga escala para máxima eficiência nas camadas mixture-of-experts que sustentam modelos como DeepSeek-R1 e Qwen3-VL.

O domínio de scale-up do NVL72, com a sexta geração de NVIDIA NVLink e NVLink Switch, entrega taxas de pacote 10x maiores e latência 3x menor que a Ethernet padrão de mercado, e é a base de interconexão que torna essas técnicas efetivas em escala de rack.

Esse codesign se estende ao ecossistema de parceiros da NVIDIA: a Nebius também submeteu resultados em preview do Vera Rubin NVL72 e demonstrou excelente performance.

Agentes de IA, que raciocinam, planejam e agem em várias etapas, estão mudando a forma de medir performance de inferência. Em benchmarks desenhados para capturar essa mudança, como o SemiAnalysis AgentX, o Vera Rubin NVL72 entregou performance 30x melhor que o GB300 NVL72 em testes de preview. Além disso, o futuro benchmark MLPerf Endpoints vai trazer medição padronizada para cargas de inferência com agentes, além do que os benchmarks tradicionais de vazão capturam.

O NVIDIA GB300 NVL72 escala com alta eficiência

Eficiência de escalabilidade, ou seja, o quanto GPUs adicionais se convertem em ganho de vazão, é uma medida central de produtividade de infraestrutura de IA. A NVIDIA entrega isso com interconexões de scale-up de alta banda e baixa latência dentro de cada rack, rede de alta banda entre racks e orquestração eficiente de requisições entre nós.

A submissão da NVIDIA no DeepSeek-R1 (DSR1) escalou de um rack GB300 NVL72 (72 GPUs) para quatro racks (288 GPUs), atingindo 99% de eficiência de escalabilidade no cenário offline. A vazão cresceu quase na mesma proporção do hardware adicionado.

Gráfico de eficiência de escalabilidade do NVIDIA GB300 NVL72 de 72 para 288 GPUs
MLPerf Inference v6.1, Closed Division. Resultados obtidos em www.mlcommons.org em 16 de setembro de 2026. Resultados da plataforma NVIDIA referentes às seguintes entradas: 6.1-0073 e 6.1-0074. O nome e o logotipo MLPerf são marcas registradas e não registradas da MLCommons Association nos Estados Unidos e em outros países. Todos os direitos reservados. O uso não autorizado é estritamente proibido. Veja www.mlcommons.org para mais informações.

Eficiência de escalabilidade é decisiva porque mais GPUs não significam automaticamente vazão proporcionalmente maior. Se quase dobrar a quantidade de GPUs entregasse só um ganho de um dígito percentual em vazão, o custo de infraestrutura superaria de longe o retorno em performance. Arquitetura, interconexão e software precisam escalar em conjunto.

O GB300 NVL72 também demonstrou eficiência em escala de rack no benchmark de texto para vídeo WAN 2.2, chegando a 0,65 vídeo 720p por segundo ou 5,7 segundos por vídeo, vazão 9x maior e latência 7,5x menor que um único nó.

Otimizações de software geram ganhos contínuos

A plataforma NVIDIA passa por desenvolvimento contínuo de software, com melhorias de performance e de recursos.

Na v6.1, a performance do GB300 NVL72 no Qwen3-VL melhorou até 1,6x em relação aos resultados da v6.0. Os ganhos vieram de menor precisão no KV cache, mais fusão de kernels, kernels melhores e serving desagregado com vLLM e NVIDIA Dynamo.

A otimização de software seguiu depois do prazo de submissão da v6.1. Resultados pós-submissão, ainda não verificados pela MLCommons, em GPT-OSS-120B e DLRMv3 mostram ganhos adicionais de performance.

Gráfico de ganhos de performance obtidos por otimizações contínuas de software da NVIDIA

Inferência de IA em qualquer escala

Além dos resultados da plataforma NVIDIA Grace Blackwell e Vera Rubin NVL72, a NVIDIA submeteu resultados do Jetson AGX Thor com o NVIDIA TensorRT Edge-LLM no novo benchmark Edge-Agentic, com o Qwen3.6-27B.

O ecossistema de parceiros da NVIDIA participou de forma ampla, com 19 parceiros, oito deles em sistemas Blackwell NVL72 multinó, demonstrando excelente performance. Entre eles: ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro e Wiwynn.

De dispositivos compactos na borda às grandes fábricas de IA, a NVIDIA segue avançando em performance por toda a stack, com cadência anual de arquiteturas de plataforma, software em melhoria contínua e um ecossistema construído para entregar isso em escala.

Saiba mais sobre a plataforma NVIDIA Vera Rubin.