Como as XPUs se Conectam a uma Fábrica de IA de Classe Mundial

A implantação de silício customizado junto à infraestrutura de IA líder do mercado permite que hyperscalers e empresas nativas de IA construam fábricas de IA flexíveis, que combinam especialização e escala.
por

Para gerar inteligência em escala, as fábricas de IA operam continuamente, e sua economia é definida pela produção entregue: tokens por segundo, tokens por watt, custo por token, utilização e uptime.

Isso exige uma infraestrutura de IA projetada e construída como uma fábrica completa, não como um conjunto de aceleradores individuais.

Hyperscalers e empresas nativas de IA que desenvolvem XPUs customizadas precisam considerar não apenas o design da XPU, mas também o design e o desenvolvimento de toda a plataforma de IA, incluindo redes scale-up e scale-out, arquitetura em escala de rack, software de fábrica em produção e um ecossistema robusto de fornecedores.

Na escala de uma fábrica de IA, esse caminho é complexo e caro, e representa um obstáculo fundamental para levar XPUs ao mercado rapidamente.

Superar essa limitação significa combinar XPUs customizadas com uma infraestrutura madura e comprovada: assim, quem constrói pode concentrar a inovação onde ela mais importa e aproveitar tecnologia já consolidada para o restante.

O NVLink Fusion atende a essa necessidade, conectando XPUs à infraestrutura de IA líder mundial da NVIDIA para aumentar a performance, acelerar o time to market e reduzir riscos em fábricas de IA semicustomizadas.

Libere a Performance das XPUs com Scale-Up Rápido

Em cargas de trabalho modernas, como a execução de modelos de trilhões de parâmetros, arquiteturas mixture-of-experts e IA baseada em agentes, se o fabric de scale-up não acompanha, a utilização cai e o custo por token sobe.

Uma solução de rede scale-up precisa se destacar em três dimensões:

  • Performance entregue: performance de rede de ponta a ponta, computação in-network e integração de software madura.
  • Resiliência da fábrica: uptime, monitoramento contínuo de saúde e telemetria, e manutenção no nível de componente enquanto a fábrica continua operando.
  • Maturidade da plataforma: menor risco operacional ao usar um stack de tecnologia maduro, com histórico comprovado de implantações em larga escala e retorno sobre o investimento já realizado.

Como exemplo, o NVLink Fusion leva as XPUs para o domínio de scale-up do NVIDIA NVLink. O NVLink de sexta geração oferece redes líderes de alta largura de banda e baixa latência em um domínio de 72 XPUs. A latência de ponta a ponta nas transferências entre XPUs é 3x menor do que em soluções alternativas baseadas em Ethernet de prateleira, e a taxa de pacotes é 10x maior.

Em performance de ponta a ponta, os sistemas NVIDIA GB300 NVL72 ajudam a entregar throughput significativamente maior e melhor interatividade em comparação com configurações que não usam o NVL72, e as próximas configurações do roadmap do NVLink incluem domínios de até 1.152 aceleradores e óptica co-packaged.

Gráfico de Pareto comparando a performance de throughput de inferência do GB300 NVL72 com a do B300, em tokens por segundo por GPU no DeepSeek-V4-Pro com ISL=1K e OSL=1K, medida em vários pontos de interatividade em tokens por segundo por usuário. O GB300 NVL72 entrega mais de 10x o throughput do B300 no meio da curva de Pareto, entre 70 e 100 tokens por segundo por usuário.
O domínio de scale-up NVLink com 72 GPUs permite que o GB300 NVL72 entregue maior throughput por GPU e mais interatividade em comparação com a NVIDIA B300. Resultados da página AI Inference Performance Benchmarks da NVIDIA.

O NVLink Fusion também inclui o NVIDIA NVLink-C2C para conectar XPUs a CPUs NVIDIA Vera ou a outras CPUs do ecossistema, entregando até 6x a eficiência energética de uma interface PCIe, o que ajuda a remover barreiras entre controle e computação em sistemas baseados em agentes.

Um Stack e um Ecossistema Comprovados para Desenvolvimento e Implantação

As equipes que desenvolvem XPUs customizadas costumam subestimar o esforço e a complexidade de transformar a inovação em XPU em uma implantação de data center. Isso inclui:

  • Integrar interfaces de CPU de alta velocidade e de scale-up
  • Selecionar e validar uma solução de rede scale-up
  • Projetar bandejas de computação e de switch
  • Projetar e validar uma arquitetura de rack, incluindo refrigeração e energia
  • Integrar segurança e armazenamento
  • Gerenciar um ecossistema complexo de fornecedores

A plataforma ideal oferece tudo isso, permitindo que as equipes foquem em inovação direcionada e usem soluções comprovadas para o restante.

O NVLink Fusion conta com um ecossistema projetado para desenvolvimento, integração e implantação rápidos, que abrange parceiros de design de ASIC, de CPU e de IP e interconexão óptica.

“O NVLink Fusion dá aos clientes a capacidade de escolher a arquitetura de CPU, o nível de performance e os recursos de software que melhor atendem às suas necessidades para as cargas de trabalho que importam para eles”, afirmou Tim Wilson, vice-presidente e gerente geral de engenharia de silício para data center da Intel.

Quem adota o NVLink Fusion também pode usar a arquitetura em escala de rack NVIDIA MGX e a mesma cadeia de suprimentos dos sistemas baseados em MGX, como o NVIDIA Vera Rubin NVL72. Os parceiros de manufatura cuidam do design e da integração, enquanto os fornecedores MGX entregam os blocos de construção para rack, refrigeração, energia e os novos projetos de 800 VDC.

“Com o Vera Rubin [NVL72], estamos falando de quase 100% de automação na montagem dos sistemas na linha de manufatura”, disse Jack Luoh, head de produto e solução na QCT e na Quanta Computer. “A maior parte desses investimentos pode ser aproveitada se a XPU usar o NVLink Fusion.”

Gestão de Riscos com Padronização de Infraestrutura

O planejamento de uma fábrica de IA não espera pelo silício. A contratação de energia, o projeto das instalações, a refrigeração, o layout dos racks e a arquitetura de rede começam muito antes de o mix final de aceleradores estar disponível. Um data center preso a um único chip pode virar um risco de cronograma.

Cargas de trabalho diferentes podem favorecer aceleradores diferentes, incluindo XPUs, GPUs, CPUs e LPUs. Sistemas com GPU podem operar ao lado de sistemas semicustomizados para treinamento, pós-treinamento, raciocínio, recuperação e serving.

“O valor do programa NVLink Fusion é … [os clientes] podem implantar a solução em nível de rack com a GPU NVIDIA e, depois, desacoplar o desenvolvimento da própria XPU e conduzi-lo em outro ritmo”, disse Vince Hu, vice-presidente sênior corporativo e gerente geral do grupo de negócios de data center e computação da MediaTek.

O NVLink Fusion resolve esses desafios com uma arquitetura unificada. Sistemas baseados em XPU e em GPU, como o Vera Rubin NVL72, podem compartilhar footprint de rack, rede, refrigeração, distribuição de energia e sistemas de gerenciamento. Os operadores podem avançar com a construção enquanto adiam a definição exata do mix de silício e, depois, reprovisionar capacidade conforme mudam a demanda das cargas de trabalho, a oferta de silício e as prioridades de negócio.

“O NVLink Fusion permite que os hyperscalers ou os projetistas de ASICs customizados integrem sua própria CPU ou XPU customizada e conecta a tecnologia da NVIDIA a um processo de terceiros para criar uma arquitetura unificada em escala de rack”, disse Lie-Szu Juang, chair e chief strategy officer da GUC.

Projetada, Validada e Operada como uma Fábrica

Construir uma fábrica é caro, e erros podem exigir retrabalho custoso. A infraestrutura precisa ser validada antes do início da obra. O NVLink Fusion está alinhado à arquitetura de referência NVIDIA DSX para fábricas de IA: codesign de prédios, energia, refrigeração, computação e rede. O NVIDIA Omniverse DSX AI Factory Blueprint oferece um gêmeo digital e um design de referência aberto para fábricas de IA em escala de gigawatt, permitindo que os parceiros modelem instalações e tecnologia em conjunto antes da implantação.

No nível do rack, a facilidade de manutenção faz parte da performance. As bandejas de computação de referência têm refrigeração 100% líquida, sem ventoinhas, cabos ou mangueiras, e podem ser removidas enquanto o restante do rack continua operando. As bandejas do NVLink Switch também são refrigeradas a líquido e permitem operação contínua durante a manutenção.

“Com o NVLink Fusion, podemos usar o design comprovado do rack NVL72 para ganhar time-to-market, e temos acesso a múltiplos fornecedores para nos ajudar a entregar mais aos nossos clientes”, disse CC Lee, gerente sênior de desenvolvimento de hardware na Annapurna Labs, uma empresa da Amazon.

O software completa a fábrica. O NVIDIA NCCL para cargas de trabalho distribuídas, o NVIDIA Dynamo e o NIXL para desagregação e o NVIDIA Mission Control para gerenciamento de cluster, telemetria e depuração ajudam os operadores a rodar uma infraestrutura de IA mista como um sistema coordenado.

Com o NVLink Fusion, as XPUs agora se conectam a uma plataforma de IA de classe mundial, permitindo que hyperscalers e empresas nativas de IA construam fábricas de IA unificadas e semicustomizadas, que reúnem os pontos fortes de muitos construtores em uma infraestrutura que nenhuma empresa conseguiria erguer sozinha.

Saiba mais sobre o NVLink Fusion.