NVIDIA e a comunidade local de IA impulsionam modelos de código aberto e agentes inteligentes.

por

O ecossistema de código aberto está facilitando para entusiastas e desenvolvedores de IA a criação, personalização e execução local de agentes cada vez mais capazes. 

Ao longo de agosto, a NVIDIA celebra os parceiros e as comunidades de código aberto que impulsionam a IA local, juntamente com os modelos, aplicações e ferramentas emergentes em todo o ecossistema. Isso inclui os mais recentes modelos abertos da NVIDIA, softwares e ferramentas de desenvolvimento, além da computação acelerada, bibliotecas e recursos educacionais que ajudam os usuários a começar.

Este promete ser um grande mês para os agentes. Acompanhe as últimas novidades nesta edição especial da série de blogs IA Local NVIDIA, com novas atualizações nas próximas semanas.

Siga o NVIDIA RTX Spark no LinkedInInstagramTikTok e Facebook — e mantenha-se informado assinando a newsletter de IA Local NVIDIA. Siga NVIDIA Workstation no LinkedIn e no LinkedIn


Terça-feira, 11 de agosto, 10h (horário do Pacífico)🔗

#ParaQuemPerdeu: Novos modelos abertos e muito mais disponíveis hoje, acelerados por GPUs NVIDIA

A NVIDIA lançou recentemente o Cosmos 3 Edge, um modelo de mundo aberto com 4 bilhões de parâmetros para robótica, veículos autônomos e inteligência artificial de visão. Com um quarto do tamanho do Cosmos 3 Nano, ele roda em dispositivos NVIDIA DGX Spark e NVIDIA Jetson.

O MiniMax-H3 é um modelo de pesos aberto com 33 bilhões de parâmetros que gera vídeo e áudio estéreo sincronizado nativamente a partir de texto, imagens, vídeo, áudio ou uma combinação dos quatro. Os criadores podem acessá-lo através do ComfyUI e executá-lo localmente com pontos de verificação otimizados para GPUs NVIDIA.

A Poolside AI lançou o Laguna S 2.1, um modelo de codificação agética de peso aberto com 118 bilhões de parâmetros, capaz de executar tarefas que duram horas. Um checkpoint NVFP4 permite que os desenvolvedores executem o modelo localmente em uma única NVIDIA DGX Spark com requisitos de computação e memória reduzidos, sem comprometer a precisão.

A DeepSeek atualizou recentemente o DeepSeek-V4-Flash, um modelo MoE com 284 bilhões de parâmetros, 13 bilhões de parâmetros ativos e uma janela de contexto de 1 milhão de tokens. Os desenvolvedores podem executá-lo localmente em uma NVIDIA DGX Station usando as versões GGUF criadas pela comunidade e disponíveis atualmente.

O Inkling-Small, do Thinking Machines Lab, é um modelo multimodal de ponta, com pesos livres e raciocínio nativo em texto, imagens e áudio, além de esforço de processamento ajustável. Treinado em uma placa NVIDIA GB300 NVL72, o modelo de 276 bilhões de parâmetros ativa apenas 12 bilhões de parâmetros por token e funciona em uma única DGX Station ou em dois sistemas DGX Spark. Um checkpoint NVFP4 otimizado para NVIDIA Blackwell está disponível na Hugging Face.

A Unsloth lançará o Unsloth Desktop na segunda-feira. O produto reúne inferência de modelos locais, difusão de imagens e vídeos, ajuste fino, integrações de agentes, pesquisa na web e execução de código em um único aplicativo de desktop totalmente de código aberto. Os materiais de lançamento o posicionam como o primeiro aplicativo de desktop capaz de treinar e executar modelos de IA localmente.

O Unsloth Desktop integra treinamento e inferência de IA local em um aplicativo de desktop totalmente de código aberto. É  o primeiro aplicativo de desktop a treinar e executar modelos de IA localmente.

A Alibaba lançou recentemente o Wan-Animate-2, um modelo open weight com 14 bilhões de parâmetros que transfere movimento e expressões faciais de um vídeo em movimento para a imagem estática de um personagem — humano, desenho animado, robô ou animal. Com suporte imediato no ComfyUI, ele gera animações até 16 vezes mais rápido em placas NVIDIA RTX PRO 5000 Blackwell (48 GB) e 26 vezes mais rápido em placas NVIDIA RTX 5090 em comparação com o Apple M3 Ultra.


Terça-feira, 11 de agosto, 9h (horário do Pacífico)🔗

LTX apresenta o LTX-2.5

O LTX-2.5 é o mais recente modelo de geração de vídeo de última geração em mundo aberto, desenvolvido pela equipe de pesquisa líder da LTX. Ele fornece a base para casos de uso em mídia e entretenimento, robótica e geração em tempo real, oferecendo vídeo de maior qualidade, melhor sincronização e personagens, cenas e vozes mais consistentes entre as gerações. 

O novo suporte para multishot permite que os criadores gerem sequências que abrangem vários cortes, mantendo a continuidade, enquanto um decodificador de vídeo de difusão aprimorado melhora a fidelidade visual e reduz artefatos. Os criadores também podem refinar filmagens existentes com edições generativas, facilitando a correção de detalhes e a manutenção de uma aparência profissional sem precisar recomeçar do zero.

O novo otimizador de prompts, que utiliza o Gemma4 E2B e um codificador de texto Gemma4 12B personalizado, proporciona uma aderência notável aos prompts, oferecendo um controle muito maior sobre a saída.

Um novo decodificador de vídeo por difusão complementa o decodificador de vídeo autoencoder variacional, melhorando a qualidade do vídeo ao fornecer um segundo caminho de decodificação para renderizações finais de maior qualidade.

O LTX-2.5 é otimizado para GPUs NVIDIA RTX e sistemas DGX Spark e DGX Station. Em uma GPU NVIDIA RTX 6000 PRO, o LTX-2.5 oferece desempenho até 20% mais rápido e economia de memória de 40%. Os criadores podem usar esses aprimoramentos do NVFP4, FastVideo e ComfyUI localmente por meio de um fluxo de trabalho ComfyUI pronto para uso, para geração de texto, imagem e vídeo a partir de vídeo. 

Saiba mais sobre o LTX-2.5 para aprender como começar a gerar vídeos locais de alta qualidade em hardware NVIDIA.


Terça-feira, 11 de agosto, 9h (horário do Pacífico)🔗

NVIDIA acelera o Muse Glimmer da Meta para IA local sempre ativa e ativa.

Hoje, a Meta lançou o Muse Glimmer, um modelo de pesos aberto, denso e com 30 bilhões de parâmetros, além de uma janela de contexto com mais de 120 mil elementos. Ele foi desenvolvido especificamente para programação e IA local com agentes.

Otimizado para PCs com NVIDIA GeForce RTX, NVIDIA DGX Spark, DGX Station e NVIDIA Jetson, o Muse Glimmer oferece mais de 200 tokens por segundo na RTX 5090, permitindo que agentes sempre ativos processem dados localmente e executem tarefas complexas de várias etapas em um único sistema.

Sua arquitetura densa e atenção híbrida ajudam a manter as demandas de processamento e memória gerenciáveis, à medida que os agentes assumem tarefas mais longas, usam ferramentas e mantêm o contexto em várias etapas.

Muse Glimmer é um modelo com 30 bilhões de parâmetros otimizado para fluxos de trabalho com agentes locais sempre ativos. É pequeno o suficiente para ser executado em um PC com uma única GPU de consumo, permitindo casos de uso que variam de agentes locais e chamadas de função a codificação local e avaliação de LLM como juiz.

Entusiastas e desenvolvedores de IA podem criar agentes usando o NemoClaw e ajustar o Muse Glimmer localmente com o NVIDIA NeMo Automodelutilizando dados privados ou especializados, mantendo-os no sistema. O Muse Glimmer foi projetado para:

  • Agentes personalizados: Adapte o modelo para tarefas, ferramentas, dados e áreas de especialização específicas.
  • Processamento de dados privados: Ler, resumir e agir sobre arquivos, documentos, e-mails e mensagens locais.
  • Gerenciamento de credenciais: Utilize chaves de interface de programação de aplicativos (API), tokens de autenticação e outras informações confidenciais, mantendo a inferência no dispositivo.
  • Tarefas com várias etapas: Execute diversas chamadas de ferramentas sequenciais e recupere-se de erros ou resultados inesperados.
  • Fluxos de trabalho de longa duração: Divida projetos maiores em etapas, acompanhe o progresso e retome sessões interrompidas mantendo o contexto intacto.

Os desenvolvedores podem executar o Muse Glimmer com frameworks de inferência populares, incluindo o vLLM para geração de texto, imagem, raciocínio e uso de ferramentas, ou o llama.cpp para cargas de trabalho de texto e imagem usando checkpoints BF16 e GGUF quantizados. O llama.cpp também suporta decodificação especulativa DFlash para acelerar a geração.

Executado em uma única NVIDIA RTX 5090, o Muse Glimmer permite que agentes sempre ativos trabalhem com arquivos, aplicativos e comunicações privados, reduzindo a dependência de inferência baseada em nuvem.

Saiba mais sobre o Muse Glimmer da Meta e confira o blog de tecnologia da NVIDIA para aprender como começar a usar IA local e fazer ajustes finos em hardware NVIDIA.


Terça-feira, 11 de agosto, 8h (horário do Pacífico)🔗

Multiplique o desempenho do DGX Spark com o NVIDIA Sync Cluster Assistant.

Novos modelos abertos, como o GLM 5.2 e o DeepSeek V4 Flash, estão trazendo inteligência de nível de nuvem para sistemas locais, possibilitando cargas de trabalho avançadas, como agentes de codificação e pesquisa. No entanto, a execução desses modelos maiores pode exigir várias GPUs ou sistemas DGX Spark trabalhando em conjunto.

As atualizações do aplicativo NVIDIA Sync facilitam o agrupamento de vários sistemas DGX Spark, fornecendo a capacidade de memória, o desempenho de inferência e a taxa de transferência de treinamento necessários para executar modelos maiores com mais rapidez. 

Disponível para Windows e macOS, o NVIDIA Sync detecta automaticamente os sistemas conectados, fornece acesso remoto privado e seguro por meio do Tailscale e permite que os desenvolvedores executem aplicativos em um ou mais sistemas DGX Spark sem a necessidade de configuração manual de rede ou comandos de terminal copiados.

Assistente de Cluster do NVIDIA Sync automatiza a configuração de dois ou mais sistemas DGX Spark como um cluster de alta velocidade. Os desenvolvedores conectam os sistemas por meio de suas portas NVIDIA ConnectX-7, e o NVIDIA Sync configura a rede, roteia as cargas de trabalho entre os nós e monitora a integridade do sistema.

Para começar a usar IA agente no DGX Spark, confira os playbooks sobre NemoClawOpenClawHermes Agent e OpenShell

Consulte o aviso referente às informações do produto de software.


Terça-feira, 11 de agosto, 8h (horário do Pacífico)🔗

Atualizações adicionais do DGX Spark

Chegarão no final de agosto duas novas funcionalidades interessantes para desenvolvedores.

O DGX Spark receberá o Google Chrome como uma versão nativa do Linux ARM64 — instalada com um único clique a partir do Painel de Controle do DGX. Isso significa que a sincronização da conta do Google, todo o ecossistema de extensões, a continuidade entre dispositivos e todos os recursos padrão em outras plataformas agora estão acessíveis no seu DGX Spark. Faça login uma vez e o ambiente do navegador será transferido do laptop para o Spark.

O novo NVIDIA Sync Resource Monitor oferece visualizações em tempo real e históricas do uso de CPU e GPU em um DGX Spark individual ou em um cluster inteiro, sem a necessidade de software ou configuração adicionais de monitoramento. Visualizações rápidas ajudam os usuários a acompanhar o progresso da carga de trabalho, verificar a capacidade disponível antes de adicionar trabalhos ou modelos e identificar rapidamente gargalos ou comportamentos inesperados. O recurso de zoom em mosaico permite que os usuários naveguem da visão geral para momentos específicos da carga de trabalho, auxiliando na solução de problemas com mais rapidez e no aproveitamento máximo de seus sistemas.


Terça-feira, 11 de agosto, 6h (horário do Pacífico)🔗

NVIDIA apresenta Nemotron 3.5 Lightning para tarefas com agentes especializados e de alta velocidade.

Hoje, a NVIDIA expandiu sua família de modelos Nemotron 3 com o Nemotron 3.5 Lightning, um modelo aberto e personalizável de 30 bits com arquitetura de mistura de especialistas (MoE) para agentes sempre ativos. 

O Nemotron 3.5 Lightning oferece geração de tokens até 4 vezes mais rápida e tempo de conclusão 30% menor em comparação com modelos abertos da mesma categoria. 

E como o Nemotron 3.5 Lightning possui pesos abertos, entusiastas e desenvolvedores de IA podem ajustá-lo com seus próprios exemplos para melhor atender a tarefas, interesses e fluxos de trabalho específicos. Por exemplo, eles poderiam treinar o modelo para: 

  • Escreva em um estilo de sua preferência: siga os tons, formatos e terminologia estabelecidos ao escrever e-mails, relatórios ou outros documentos.
  • Aprenda uma especialidade: Compreenda melhor a linguagem e as tarefas comuns associadas a áreas como fotografia, jogos ou design 3D.
  • Codifique de uma determinada maneira: siga as convenções de codificação, frameworks e abordagens de teste preferidas ao escrever, revisar ou refatorar código.

Em conjunto com o acesso a aplicativos, arquivos e outras ferramentas, esses modelos refinados podem impulsionar experiências de IA locais mais personalizadas — desde um assistente que ajuda a gerenciar e-mails e calendários, até um agente para casa inteligente que lida com as rotinas diárias, passando por um companheiro de programação que trabalha em conjunto com os desenvolvedores em uma base de código local.

A NVIDIA colaborou com vLLM, Ollama, llama.cpp e LM Studio para proporcionar a melhor experiência de implantação local para os modelos Nemotron 3.5 Lightning, oferecendo aos desenvolvedores a opção de escolher entre os formatos NVFP4 e GGUF. A Unsloth também oferece suporte desde o primeiro dia com modelos otimizados e quantizados para uma implantação local eficiente por meio do Unsloth Studio.

O Nemotron 3.5 Lightning funciona localmente em PCs NVIDIA RTXsistemas NVIDIA DGX Spark e OEM GB10, e NVIDIA Jetson, e escala para workstations RTX PRO, sistemas workstations NVIDIA DGX Station e GB300, data centers e ambientes de nuvem. Com sistemas NVIDIA Blackwell disponíveis da Acer, ASUS, Dell Technologies, Exxact, GIGABYTE, HP, Lenovo, MSI e Supermicro, os usuários podem escolher entre uma ampla gama de dispositivos e formatos para atender às suas necessidades.

Com a crescente adoção da IA ​​generativa, as empresas buscam maneiras de controlar o aumento dos custos dos tokens sem sacrificar o acesso à inteligência de ponta. O NVIDIA NeMo Switchyard, uma biblioteca de roteamento de código aberto, direciona automaticamente cada etapa do fluxo de trabalho de um agente para o modelo mais adequado com base em precisão, velocidade e custo. Ele também oferece aos desenvolvedores a flexibilidade de trabalhar com diferentes modelos e provedores para diversas tarefas. 

Testes internos demonstram que o NeMo Switchyard, ao rotear cada etapa por meio de um sistema de modelos, ajudou a manter a conclusão de tarefas em um nível de ponta, reduzindo o custo de conclusão dos testes de desempenho para aproximadamente um terço do custo do Opus 4.8. O NeMo Switchyard está disponível no GitHub.

Visite os blogs técnicos do Nemotron 3.5 Lightning , NeMo Switchyard e Jetson AI para começar. E para desenvolver na borda, comece com os tutoriais do Jetson AI Lab e descubra projetos Jetson do mundo real . O Nemotron 3.5 Lightning também está disponível através do OpenRouter, em build.nvidia.com como um microsserviço NVIDIA NIM e através de um amplo ecossistema de parceiros NVIDIA Cloud, plataformas de pós-treinamento, plataformas de inferência e provedores de serviços em nuvem. O NeMo Switchyard está disponível no GitHub.