Nemotron 3 : les modèles ouverts de NVIDIA conçus pour les agents
Nemotron 3 Ultra de NVIDIA : 550B en poids ouverts, orienté agents, solide sur l'index, gratuit dès le premier jour. Une vraie option on-prem.
Traduction produite automatiquement par IA. La version allemande est l'original vérifié par la rédaction.
Un modèle open-weight à l'échelle frontière conçu pour des agents de longue durée plutôt que pour la conversation, et qui tourne vite sur du matériel NVIDIA que de nombreux clients possèdent déjà. C'est ce qui fait de Nemotron 3 une véritable option on-prem. NVIDIA a complété la famille au Computex avec Nemotron 3 Ultra, un modèle Mixture-of-Experts de 550 milliards de paramètres (55B actifs), publié le 4 juin sous la licence Open MDW de la Linux Foundation.
01. Solide sur l'index, intéressant sous le capot
Selon Artificial Analysis, Ultra obtient 47,7 à son Intelligence Index, le meilleur modèle open-weights américain, devant Gemma 4 31B (39,2) et le plus petit Nemotron 3 Super (36,0).
Le rapport technique détaille la partie intéressante : un MoE hybride Mamba-Attention avec LatentMoE, un entraînement en NVFP4 et des couches de multi-token-prediction pour un décodage spéculatif natif, jusqu'à 5x de débit en plus par rapport à la génération précédente, avec une fenêtre de contexte allant jusqu'à 1M de tokens.
02. Conçu pour les agents, pas pour la conversation
NVIDIA a été explicite au lancement : Nemotron 3 est fait pour les « problèmes agentiques où une IA cherche à résoudre des tâches difficiles de façon autonome », un usage d'outils sur la durée plutôt que la conversation. La famille est dimensionnée pour les configurations NVIDIA courantes : Nano (30B) pour le matériel grand public, Super (120B) et Ultra à l'échelle frontière.
Les réactions se sont divisées de façon prévisible. Les développeurs ont apprécié l'économie : un premier test a vu Ultra accomplir une tâche à forte composante physique pour environ 5 cents contre environ 57 cents sur un modèle fermé comparable, environ 10x moins cher, et il est arrivé gratuitement sur OpenCode et OpenRouter dès le premier jour. Les sceptiques, comme l'analyse de harness de Fluid Coding, ont posé la bonne question : un beau tableau de benchmarks n'est pas la même chose que rester cohérent au fil d'une vraie boucle d'agent de code avec des outils, des logs cassés et 10 tours de mémoire. Les confrontations directes sur r/LocalLLaMA sont déjà en cours.
03. Pourquoi nous y prêtons attention
Un modèle à l'échelle frontière, open-weight, orienté agents et qui tourne vite sur du matériel NVIDIA que beaucoup de nos clients possèdent déjà est une option sérieuse pour l'IA on-prem. Des poids ouverts, un débit élevé et un contexte d'un million de tokens : c'est la combinaison qui rend déployables des agents autonomes de longue durée au sein de l'environnement propre d'un client, sans facture par token d'un fournisseur, sans que les données ne quittent la maison.
Comme toujours, la preuve se fait dans le harness, pas dans le classement. Mais Nemotron 3 fait passer l'IA agentique auto-hébergée du possible au praticable.

