Por que Agentes de Longa Duração Estão Queimando Seu Orçamento
Vamos lá, dev! Você já percebeu que aqueles chatbots de turno único estão evoluindo para agentes que raciocinam, mantêm contexto, usam ferramentas e invocam sub-agentes? Só que, conforme esses workflows multi-agente escalam, a contagem de tokens explode. Cada plano, chamada de ferramenta, invocação de sub-agente e passo de raciocínio é realimentado no modelo, aumentando latência e custo. Resultado: deriva de objetivo e contas de inferência nas alturas.
A NVIDIA resolve isso com uma abordagem de sistema de modelos: use modelos de raciocínio de fronteira para orquestração e planejamento complexo, e modelos eficientes para execução em alto volume. Hoje, eles estão lançando o Nemotron 3 Ultra — um modelo MoE aberto de 550B parâmetros com 55B ativos, feito exatamente para essa divisão.

Comparativo de Benchmarks: Nemotron 3 Ultra vs. Qwen3.5, Kimi K2.6, GLM 5.1
A NVIDIA publicou uma tabela completa de benchmarks cobrindo produtividade de agente, planejamento de longo horizonte, codificação, seguimento de instruções, trabalho de conhecimento e recall de contexto longo. Olha só:
| Benchmark | Nemotron 3 Ultra (550B) | GLM 5.1 (744B) | Kimi K2.6 (1T) | Qwen3.5 (397B) |
|---|---|---|---|---|
| Produtividade de Agente PinchBench | 91% | 84% | 91% | 89% |
| Planejamento Longo Horizonte EnterpriseOps-Gym | 33% | 40% | 29% | 30% |
| Codificação Terminal-Bench 2.0 | 54% | 64% | 67% | 53% |
| Seguimento de Instruções IFBench | 82% | 77% | 74% | 78% |
| Trabalho de Conhecimento GDPVal-AA | 1,448 | 1,594 | 1,508 | 1,192 |
| Tarefas Profissionais ProfBench (Search) | 56% | 46% | 56% | 53% |
| Contexto Longo Ruler @1M | 95% | N/A (max 256K) | N/A (max 256K) | 90% |
Principais conclusões:
- Nemotron 3 Ultra empata com Kimi K2.6 em produtividade de agente (91%) e trabalho profissional (56%), enquanto lidera em seguimento de instruções (82%) e recall de contexto longo (95%).
- Ele atinge 5x mais throughput comparado a outros modelos abertos da mesma classe, graças à precisão NVFP4 e à previsão multi-token.
- No SWE-bench e Terminal-Bench 2.0, usa menos tokens totais e menos tokens por turno, reduzindo custos de tarefas agênticas em até 30%.
O que Torna Isso Possível? Inovações na Arquitetura
A NVIDIA empacotou cinco inovações principais no Nemotron 3 Ultra:
- Hybrid Mamba + Transformer: Camadas Mamba melhoram a eficiência de sequência para workloads de contexto longo; camadas Transformer preservam recall preciso para recuperação de fatos.
- Precisão NVFP4: Um checkpoint roda em GPUs Hopper, Blackwell e Ampere. Entrega até 5x mais throughput por GPU comparado a BF16 em Blackwell.
- LatentMoE: Roteamento de especialistas mais eficiente para workflows que abrangem raciocínio, geração de código, chamadas de ferramentas e lógica de domínio específico.
- Previsão Multi-Token (MTP): Prevê múltiplos tokens futuros em uma única passagem direta, melhorando o throughput para saídas longas e workflows multi-turno.
- Destilação Multi-Professor On-Policy (MOPD): Mais de 10 modelos professores especializados fornecem sinais de recompensa densos durante o treinamento, permitindo melhoria contínua de capacidade entre domínios.

Cuidado: Onde o Nemotron 3 Ultra Deixa a Desejar
Nenhum modelo é perfeito. Aqui estão as limitações que você deve considerar antes de adotar o Nemotron 3 Ultra:
- Planejamento de longo horizonte é fraco: Com 33% no EnterpriseOps-Gym, fica atrás do GLM 5.1 (40%). Se seu agente precisa planejar dezenas de passos, talvez não seja a melhor escolha.
- Codificação é mediana: Pontuação de 54% no Terminal-Bench 2.0 é inferior a GLM 64% e Kimi 67%. Para tarefas de geração de código, considere parear com um modelo especializado.
- Trabalho de conhecimento é médio: Score de 1.448 no GDPVal-AA é menor que GLM 5.1 (1.594) e Kimi K2.6 (1.508). Para tarefas intensivas em conhecimento, você pode precisar de outro backbone.
- Requisitos de hardware: 550B parâmetros totais significa que você precisa de memória GPU significativa. Mesmo com NVFP4, rodar localmente em hardware de consumo não é viável. Recomenda-se deploy em nuvem.
Como Começar
O Nemotron 3 Ultra é totalmente aberto — pesos, dados e receitas — sob licença OpenMDW-1.1. Você pode:
- Baixar os pesos do Hugging Face
- Testar no Perplexity Pro, OpenRouter ou Anaconda
- Fazer deploy como microsserviço NIM via ecossistema de parceiros da NVIDIA (AWS SageMaker, Google Cloud, Microsoft Foundry, Oracle Cloud)
- Fine-tune usando LoRA, SFT ou RL com as bibliotecas NVIDIA NeMo
Para um tutorial completo, confira o cookbook do Nemotron 3 Ultra e o repositório oficial no GitHub para integrações com harnesses de agente (BlackBox AI, Cline, CrewAI, LangChain, OpenHands e muito mais).

Conclusão: Vale a pena usar o Nemotron 3 Ultra?
Se você está construindo workflows multi-agente de longa duração e se preocupa com eficiência de custos, o Nemotron 3 Ultra é um forte candidato. Sua melhoria de 5x no throughput e redução de até 30% nos custos o tornam uma escolha prática para sistemas de agente em produção. No entanto, se seu caso de uso exige forte planejamento de longo horizonte ou geração de código de alto nível, talvez você queira pareá-lo com modelos especializados.
Próximos passos para aprendizado:
- Leia o relatório técnico do Nemotron 3 Ultra para detalhes completos da arquitetura
- Experimente a receita MOPD usando NeMo-RL
- Veja o padrão Data Canary da Netflix para validar pipelines de dados em produção
- Descubra como o Spotify Honk automatizou 240 migrações de datasets usando gerenciamento de frota Backstage
Mais uma coisa: Embora o Nemotron 3 Ultra seja impressionante, sempre faça benchmark contra seu workload específico. O melhor modelo para seu agente é aquele que equilibra acurácia, latência e custo para seu caso de uso único.