A inteligência de fronteira está indo para o local. Na IFA 2026, NVIDIA, Microsoft e parceiros se uniram para entregar inferência mais rápida e novas ferramentas que tornam os agentes mais fáceis de configurar e rodar localmente em hardware NVIDIA. Novos PCs compactos com Windows NVIDIA RTX Spark também chegam em outubro, dando a entusiastas de IA, desenvolvedores e criadores mais formas de rodar agentes capazes localmente e com segurança.
Os anúncios de hoje incluem:
- Suporte simplificado de IA local para GPUs NVIDIA chegando ao Hermes Agent, ao OpenClaw e ao Perplexity Portable Computer.
- Inferência local até 1,9 vez mais rápida: novas otimizações de llama.cpp e vLLM já disponíveis diretamente e por meio do LM Studio e do Ollama.
- NVIDIA PAIR, uma ferramenta de roteamento pessoal de IA que distribui de forma inteligente a inferência entre os PCs da rede local do usuário.
- NVIDIA RTX Spark chega em outubro, com novos PCs com Windows da Lenovo e da Acer. Electronic Arts, Embark e Ubisoft estão entre as editoras e desenvolvedoras que estão levando seus títulos para o NVIDIA RTX Spark.
Agosto também foi um mês movimentado para a IA local:
- Nemotron 3.5 Lightning, que roda em NVIDIA RTX PCs, workstations RTX PRO, DGX Spark e Jetson, é um modelo de 30 bilhões de parâmetros já lançado.
- O GLM-5.3-Flash, da Z.ai, é um modelo multimodal de mistura de especialistas (MoE) que está levando IA baseada em agentes para a DGX Station.
- A Qwen lançou o Qwen3.8-Flash-Next, um modelo multimodal MoE de pesos abertos que roda localmente em DGX Spark e DGX Station, junto do Qwen3.8-27B, modelo aberto de 27 bilhões de parâmetros otimizado para cargas locais de agentes e de codificação em GPUs NVIDIA.
- O LTX 2.5, da LTX, é um modelo aberto de geração de vídeo otimizado para GPUs NVIDIA RTX, DGX Spark e DGX Station, com novos aprimoramentos de NVFP4, FastVideo e ComfyUI para geração local mais rápida e mais eficiente em memória.
- O MiniMax-H3 é um modelo de pesos abertos para geração de vídeo com áudio sincronizado que roda localmente em GPUs NVIDIA pelo ComfyUI. A FastVideo trabalhou com pesquisadores da NVIDIA para melhorá-lo ainda mais com o FastH3, uma versão destilada de pesos abertos em quatro passos que melhora a performance em 7 vezes.
- O Muse Glimmer, da Meta, é um modelo de pesos abertos com 30 bilhões de parâmetros para codificação e cargas de agentes que roda localmente em PCs GeForce RTX, DGX Spark, DGX Station e Jetson. A NVIDIA também lançou a quantização NVFP4 com suporte a DGX Spark para uma implantação local mais eficiente em memória.
- O DeepSeek v4 Flash é um modelo MoE de 284 bilhões de parâmetros com 13 bilhões de parâmetros ativos que roda localmente em um cluster de 2 DGX Spark e na DGX Station.
Um começo mais simples para agentes locais
Colocar um agente local para rodar com modelos locais exigia algum esforço: escolher um modelo, achar um servidor de inferência compatível, ajustar configurações de quantização e manter tudo atualizado. Esse atrito está desaparecendo em sistemas RTX e DGX.
Três dos aplicativos de agente mais usados vão oferecer setup simplificado de modelo local no Windows, cada um construído sobre llama.cpp e incorporando as otimizações de inferência mais recentes da NVIDIA. As novas experiências de configuração foram desenhadas para reduzir a configuração manual e facilitar colocar agentes locais para rodar.
No mês passado, a Perplexity apresentou seu agente Portable Computer, que dá aos usuários uma forma simples de rodar a Perplexity localmente em sistemas Linux como o NVIDIA DGX Spark, com modelos, orquestração e ferramentas empacotados em uma única experiência de aplicativo.
O Perplexity Portable Computer está disponível em GPUs NVIDIA RTX com pelo menos 24 GB de VRAM rodando Linux, e o suporte no Windows chega em breve, levando essa mesma configuração simplificada para um grupo maior de usuários de PC. É possível rodar workflows completos localmente sem consumir créditos, escalando seletivamente partes de uma tarefa para um dos mais de 15 modelos de fronteira na nuvem quando é preciso mais pesquisa ou raciocínio. O Portable Computer pede permissão antes de enviar conteúdo para a nuvem, o que ajuda a manter informação sensível no dispositivo. Alguns exemplos de uso:
- Engenharia: revisar PRs abertos em um repositório conectado do GitHub e classificá-los entre prontos, bloqueados, parados e a revisar, cada um com o próximo passo marcado. Documentação que ficou fora de sincronia com o último merge é identificada e corrigida, com um PR aberto para as mudanças.
- Finanças: apontar o agente para dois anos de extratos de corretora, informes consolidados e declarações de imposto e pedir que ele rastreie as posições recorrentes que geram mais taxas e perdas fiscais evitáveis, com cada número citando o arquivo e a página exatos, sem que nenhum documento chegue a um chatbot.
- Startups: perguntar por que a ativação estagnou, e o agente analisa localmente o export do funil para achar onde os novos cadastros abandonam entre a instalação e a primeira tarefa concluída, e depois posta os principais insights direto no canal do time no Slack.
O Hermes Agent, desenvolvido pela Nous Research, é um agente de propósito geral usado por milhões de pessoas, que se destaca em confiabilidade e automelhoria. Agnóstico de modelo e de provedor, o Hermes foi feito para rodar o dia inteiro em sistemas locais, o que torna PCs RTX, workstations RTX PRO e DGX Spark uma combinação natural.
Configurar um modelo local no Hermes vai oferecer setup em um clique em sistemas RTX e DGX no Windows. O agente detecta automaticamente a GPU NVIDIA, escolhe um modelo e uma configuração adequados e o executa por meio do llama.cpp integrado, já com as otimizações de inferência da NVIDIA, eliminando downloads e ajustes manuais. O suporte a Linux chega em breve.
Uma vez rodando, o Hermes funciona como funcionaria em qualquer outro lugar. Ele usa ferramentas, mantém contexto entre tarefas, lembra informações entre sessões e cria skills reutilizáveis ao longo do tempo, o que permite que o agente fique mais capaz com o uso contínuo. Rodar o modelo localmente em uma GPU mantém a performance alta e os dados no sistema.
O setup de modelo local em um clique já está disponível no Windows, com suporte a Linux chegando em breve.
O OpenClaw se tornou um dos projetos que definem o movimento de agentes abertos: é o maior projeto de IA no GitHub, com mais de 380 mil estrelas e uma comunidade em rápido crescimento que constrói ferramentas e skills em pesquisa, engenharia, gestão de projetos e produtividade do dia a dia.
NVIDIA, Microsoft e OpenClaw vêm trabalhando em conjunto para tornar essa experiência mais fácil de configurar em PCs com Windows. Para reduzir o atrito de onboarding, o app do OpenClaw para Windows simplifica o processo de configurar um modelo local otimizado em qualquer GPU RTX com pelo menos 24 GB de VRAM.
Inferência mais rápida dá um empurrão nos agentes locais
A performance de inferência é crítica para manter os agentes locais responsivos. A NVIDIA segue colaborando com as comunidades open source do llama.cpp e do vLLM para acelerar cargas de trabalho com agentes nas plataformas NVIDIA locais.

O llama.cpp entrega throughput até 1,9 vez maior por meio de otimizações de kernel em uma GeForce RTX 5090, técnicas aprimoradas de decodificação especulativa e prefill mais rápido.
O vLLM entrega 1,2 vez na RTX PRO 6000 Blackwell Workstation Edition e até 1,4 vez em dois clusters DGX Spark. Novos kernels de atenção XQA no FlashInfer e otimizações de backend ajudam a acelerar a inferência nas duas plataformas.
Esses ganhos estão disponíveis nos backends de inferência llama.cpp e vLLM. Os usuários também podem acessá-los pelos aplicativos LM Studio e Ollama.
Use PCs ociosos para ter mais computação local com o NVIDIA PAIR
Mais da metade dos domicílios nos EUA tem dois ou mais PCs, e boa parte desse poder de computação fica ociosa ao longo do dia. O NVIDIA Personal AI Router (PAIR) é uma ferramenta de software gratuita e de código aberto que coloca esses sistemas para trabalhar juntos em IA local.
Workflows com agentes costumam quebrar tarefas complexas em trabalhos menores que podem rodar em paralelo, mas a performance cai quando todas as requisições disputam a mesma GPU. O PAIR descobre automaticamente os PCs compatíveis na rede local e roteia requisições independentes de inferência para o sistema que tiver capacidade. Ele funciona com Ollama e LM Studio e se adapta conforme dispositivos entram ou saem da rede.
Por exemplo, o usuário pode pedir ao Hermes que monte um plano de organização do domingo, filtrando uma caixa de entrada bagunçada e priorizando o que precisa de atenção agora, o que pode esperar e o que pode ser ignorado. O Hermes divide esse trabalho entre vários subagentes, enquanto o PAIR distribui essas tarefas entre os PCs disponíveis em vez de deixar todas esperando por uma única GPU.
O resultado é mais computação para agentes locais, com mais tarefas rodando em paralelo e a flexibilidade de mover cargas de IA para outro PC enquanto o sistema principal está sendo usado para jogar, criar ou trabalhar.
O beta do NVIDIA PAIR está disponível para Windows, macOS e Linux, com interface gráfica e de terminal, e suporta GPUs NVIDIA GeForce RTX série 20 e mais novas, GPUs NVIDIA RTX PRO para workstation (arquitetura Turing e mais novas), NVIDIA DGX Spark e chips Apple M4 ou mais novos.
Edição de fotos no dispositivo com o PhotoDirector AI PC Mode da CyberLink no RTX Spark
Modelos abertos de imagem e vídeo permitem que artistas experimentem modelos de IA criativa em PCs, iterando e explorando conceitos sem a ansiedade de gastar tokens e mantendo mais do trabalho criativo privado e no dispositivo.
O novo PhotoDirector AI PC Mode, da CyberLink, é uma das primeiras aplicações a integrar esses modelos de difusão diretamente em um software criativo. Chegando ao PhotoDirector 365 e otimizado para o NVIDIA RTX Spark no lançamento, o AI PC Mode traz ferramentas de edição com IA para edição generativa, melhoria de imagem, remoção de objetos e distrações, remoção e substituição de fundo, refinamento de retratos e criação de imagens inteiramente novas, com a flexibilidade de escolher entre processamento local ou na nuvem, dependendo da tarefa.
Em GPUs NVIDIA, o PhotoDirector usa TensorRT-RTX e FP8 para acelerar a IA local.
PCs com Windows NVIDIA RTX Spark chegam em outubro de 2026
O NVIDIA RTX Spark chega em outubro, e na IFA 2026 os parceiros mostraram seus produtos. Novos designs anunciados se juntam às seis OEMs que já começam a vender em outubro. A Acer mostrou seu conceito de desktop compacto RTX Spark, e a Lenovo anunciou o Yoga Pro 9n e o Yoga 9n 2 em 1.
O RTX Spark é um novo começo para os PCs com Windows. Um PC feito para criadores, gamers e agentes de IA. Com uma GPU RTX Blackwell de 1 petaflop, até 128 GB de memória unificada e uma CPU Grace de 20 cores altamente eficiente, o RTX Spark entrega performance e eficiência. Esse superchip viabiliza notebooks finos de alta performance com bateria para o dia todo e desktops compactos para sustentar agentes sempre ativos. Combinado com o novo Windows Agent framework, permite agentes que rodam com segurança em segundo plano sob controle do sistema operacional.
Na semana passada, na Gamescom, Electronic Arts, Embark e Ubisoft estiveram entre as editoras e desenvolvedoras que levaram seus títulos para os PCs com Windows NVIDIA RTX Spark. Elas se juntam às editoras que anunciaram suporte ao RTX Spark na COMPUTEX, em maio, incluindo KRAFTON, NetEase, Riot Games e XBOX.
Mais atualizações da IA local da NVIDIA
🎮 NVIDIA leva novas tecnologias RTX e jogos à Gamescom. A NVIDIA lançou o DLSS 4.5 Ray Reconstruction, com um novo modelo transformer de segunda geração para melhorar a qualidade de imagem em jogos com ray tracing e path tracing.
🐋 Chega o DeepSeek Harness. O novo harness de código aberto da DeepSeek se combina ao DeepSeek-V4-Flash para sustentar workflows locais de codificação com agentes em NVIDIA DGX Station e em configurações com múltiplos DGX Spark.
📊 MLPerf Client v2.0 amplia o benchmarking de AI PCs. A MLCommons lançou o MLPerf Client v2.0, desenvolvido em colaboração com a NVIDIA e outros líderes da indústria. A atualização adiciona novos benchmarks para IA baseada em agentes e geração de imagens, além de testes ampliados de LLM para cargas locais do mundo real.
