À medida que a IA evolui de chatbots para agentes autônomos, os modelos de código aberto atendem às demandas do mercado por controle total sobre onde a IA é executada e como é implantada e evolui.
Hoje, a NVIDIA está expandindo sua família de modelos Nemotron 3 com o Nemotron 3.5 Lightning, o modelo de maior eficiência em sua classe para cargas de trabalho de IA baseada em agentes de longa duração. Este lançamento segue o Nemotron 3 Nano e reflete o compromisso da NVIDIA em aprimorar continuamente os modelos de código aberto para maior precisão e velocidade.
Desenvolvido para tarefas especializadas dentro de sistemas multiagentes maiores, o Nemotron 3.5 Lightning, um modelo de mistura de especialistas com 30 bilhões de parâmetros, ajuda a criar aplicações baseada em agentes mais inteligentes e eficientes.
Além disso, a NVIDIA está lançando o NeMo Switchyard, uma biblioteca de código aberto para roteamento inteligente dentro de ferramentas de agentes populares. As empresas podem usá-la para construir um roteador com base em suas necessidades específicas. Quando implantado, o NeMo Switchyard pode direcionar de forma inteligente cada solicitação ao modelo mais capaz e adequado para a tarefa, em uma combinação própria de modelos abertos, proprietários e da NVIDIA, sem exigir que os desenvolvedores reescrevam suas aplicações.
Juntos, o Nemotron 3.5 Lightning e o NeMo Switchyard oferecem maior controle sobre como a IA é implantada, onde é executada e com que eficiência opera — em PCs, workstations, data centers e na nuvem.

O Nemotron 3.5 Lightning oferece inteligência de nível frontier em um modelo de código aberto pequeno e personalizável, desenvolvido para workflows agênticos de alto volume.
Agentes Sempre Ativos Precisam de um Sistema de Modelos
Os sistemas agênticos modernos — agentes sempre ativos — operam cada vez mais como sistemas de modelos, ou conjuntos de modelos, com diferentes modelos especializados para diferentes tarefas.
Os modelos de código aberto NVIDIA Nemotron foram desenvolvidos para essa arquitetura. Um modelo de raciocínio frontier como o Nemotron 3 Ultra ou o GPT-5.6 pode planejar e orquestrar um workflow, enquanto modelos especializados menores como o Nemotron 3.5 Lightning podem realizar tarefas específicas, como revisão de código, uso de ferramentas, monitoramento de alertas de segurança e resposta a perguntas sobre faturamento.
Potencializando Tarefas Especializadas de Alto Volume com o Nemotron 3.5 Lightning
O NVIDIA Nemotron 3.5 Lightning é um modelo de código aberto totalmente personalizável, desenvolvido para tarefas de alto volume que alimentam agentes sempre ativos. Foi desenvolvido com contribuições da Nemotron Coalition, cujos membros forneceram metodologias de avaliação, software de inferência e datasets para ajudar a avançar o modelo.
O modelo oferece até 4x mais velocidade de saída, resultando em 30% mais rapidez na conclusão de tarefas agênticas em comparação com outros modelos de sua classe. E por ser aberto e personalizável, o Nemotron 3.5 Lightning pode ser facilmente pós-treinado com o NVIDIA NeMo usando dados de domínio, ferramentas e workflows próprios da organização para melhorar a precisão em tarefas especializadas.

Os benchmarks PinchBench demonstram que o Nemotron 3.5 Lightning oferece conclusão de tarefas agênticas mais rápida com precisão de nível frontier em comparação com outros modelos de sua classe.
Líderes de IA em diversos setores estão personalizando o Nemotron 3.5 Lightning para suas cargas de trabalho, incluindo a CrowdStrike para cibersegurança, a Harvey com a Trajectory para serviços jurídicos e a CodeRabbit com a Baseten para revisão de código, ajudando a melhorar a precisão para tarefas agênticas específicas de domínio. Além disso, a Lila Sciences está contribuindo para aprimorar os recursos de raciocínio para tarefas agênticas nas ciências físicas e da vida, e a Fastino Labs personalizou o modelo e está obtendo precisões líderes para cargas de trabalho de desenvolvimento de software, finanças e saúde.

As empresas personalizaram o Nemotron 3.5 Lightning para alcançar precisão líder em suas tarefas especializadas em seus workflows agênticos.
O Nemotron 3.5 Lightning também oferece às organizações controle sobre privacidade e implantação. Pode ser executado em sistemas de IA locais — incluindo NVIDIA RTX PCs, NVIDIA DGX Spark, NVIDIA DGX Station e NVIDIA Jetson — para ajudar os usuários a maximizar os investimentos em infraestrutura existente, ou escalar em dispositivos de IA edge, workstations NVIDIA RTX PRO, data centers e ambientes de nuvem para casos de uso empresariais. E o Nemotron 3.5 Lightning pode ser executado localmente ou no local para tarefas especializadas de alto volume que exigem respostas rápidas.
Além disso, como em todo lançamento Nemotron, a NVIDIA publica o máximo possível dos dados de treinamento e técnicas conforme permitido pelo licenciamento, o que permite rastreabilidade, auditoria e treinamento de outros modelos. Junto com o Lightning, a NVIDIA está lançando o Nemotron-RL-Agentic-Terminal-Pivot, um dataset de aprendizado por reforço agêntico usado para pós-treiná-lo para capacidades de agentes de codificação.
Aplicações de IA Mais Eficientes com Roteamento de Modelos
Alguns modelos são melhores para codificação, outros para raciocínio, alguns para tarefas leves e outros são otimizados para execução local com maior privacidade e eficiência. Se os clientes dependem de um modelo padrão único, podem gastar demais ou perder qualidade; se gerenciam o roteamento manualmente, isso se torna trabalho de integração que pode atrasar uma implantação.
O NVIDIA NeMo Switchyard é uma biblioteca de roteamento de modelos de código aberto para agentes de IA. A tecnologia direciona os prompts ao modelo mais capaz e eficiente para cada etapa de um workflow de agente automaticamente, com base em necessidades específicas. Os desenvolvedores de aplicações de agentes podem ajustar ou modificar o roteador com diferentes algoritmos de roteamento para corresponder às suas prioridades, como qualidade, latência e requisitos de custo. Em um sistema de modelos, as empresas podem criar agentes de IA poderosos com tokenomics aprimorada.
Benchmarks internos mostram que o NeMo Switchyard mantém precisão de nível frontier enquanto reduz o custo de conclusão de tarefas para quase um terço do Opus 4.8 sozinho.

Benchmarks internos da NVIDIA mostram que o NeMo Switchyard mantém precisão de nível frontier enquanto reduz o custo de conclusão de tarefas para quase um terço do Opus 4.8 sozinho.
A NVIDIA está trabalhando com parceiros em todo o ecossistema de IA para trazer roteamento inteligente de modelos às ferramentas e plataformas que os desenvolvedores já utilizam.
- Boomi: Avaliou o Switchyard em cinco capacidades de roteamento, alcançando 100% de precisão de roteamento de domínio, enviando 59% do tráfego para um modelo ajustado 5x mais rápido e reduzindo a latência em turnos posteriores em 21%.
- Cadence: Melhorou a eficiência em 9,9% usando o ChipStack AI Super Agent para um caso de uso de verificação formal.
- Classmethod: Está executando cargas de trabalho opencode e Fireworks usando o NeMo Switchyard internamente, com testes iniciais mostrando redução de custo de 27% mantendo a qualidade.
- Cognition: Integrou o roteador em estágios do NVIDIA NeMo Switchyard ao Devin Desktop para uso interno da NVIDIA, alcançando desempenho próximo ao frontier no FrontierCode Main enquanto reduzia o custo médio em 28% em relação ao roteamento de todas as solicitações para um único modelo frontier subjacente.
- Kong: Oferece roteamento com NeMo Switchyard nativamente através do Kong AI Gateway.
- LangChain: Com o NeMo Switchyard, alcançou 74% de redução de custo em 145 tarefas de Deep Agents de múltiplos turnos, roteando apenas 7% das chamadas para um modelo frontier, com uma troca de precisão de 6%.
- LiteLLM: Está adicionando o NeMo Switchyard como um plug-in em sua camada de proxy para que os desenvolvedores possam acessar esses benefícios sem alterar sua stack existente.
- Nous Research: Integrou o NeMo Switchyard ao Hermes para fornecer aos desenvolvedores um sistema de roteamento fácil de configurar para melhorar a eficiência dos agentes.
- Ramp: Usou o NeMo Switchyard para igualar o desempenho de um modelo frontier enquanto reduzia os custos em 58% e o tempo de execução em 33% no Ramp SWE-Bench.
- Siemens: Está realizando benchmarks para melhorar a eficiência em seu Fuse EDA AI Agent.
O Nemotron 3.5 Lightning está disponível no Hugging Face, ModelScope, OpenRouter e build.nvidia.com como um microserviço NVIDIA NIM, bem como por meio de um amplo ecossistema de parceiros de nuvem NVIDIA, plataformas de pós-treinamento, plataformas de inferência e provedores de serviços em nuvem. O NeMo Switchyard está disponível no GitHub e em breve chegará às plataformas de parceiros.
