IA · 5 MIN

Nemotron 3: i modelli aperti di NVIDIA costruiti per gli agenti

Nemotron 3 Ultra di NVIDIA: 550B di pesi aperti, orientato agli agenti, forte nell'indice, libero dal primo giorno. Un'opzione on-premise concreta.

Nemotron 3: i modelli aperti di NVIDIA costruiti per gli agenti
LUOGO
Germania
AUTORE
Aashwin Shrivastava
PUBBLICATO
15 giu 2026
IMMAGINE
GENERATO CON IA

Traduzione generata automaticamente con IA. La versione tedesca è l'originale verificato dalla redazione.

Un modello di dimensioni al vertice con pesi aperti, costruito per agenti a lungo termine invece che per la chat, che gira velocemente su hardware NVIDIA che molti clienti già possiedono. Questo rende Nemotron 3 una vera opzione on-premise. NVIDIA ha completato la famiglia al Computex con Nemotron 3 Ultra, un modello Mixture-of-Experts con 550 miliardi di parametri (55B attivi), pubblicato il 4 giugno sotto la licenza Open-MDW della Linux Foundation.

01. Forte nell'indice, interessante sotto il cofano

Secondo Artificial Analysis, Ultra raggiunge 47,7 sul suo Intelligence Index, il modello open-weights statunitense più forte, davanti a Gemma 4 31B (39,2) e al più piccolo Nemotron 3 Super (36,0).

Il rapporto tecnico descrive la parte interessante: un MoE ibrido Mamba-Attention con LatentMoE, addestramento NVFP4 e livelli di Multi-Token-Prediction per la decodifica speculativa nativa, fino a 5 volte più throughput rispetto alla generazione precedente, con una finestra di contesto fino a 1M di token.

02. Costruito per gli agenti, non per la chat

NVIDIA è stata chiara al lancio: Nemotron 3 è pensato per "problemi agentici, in cui una IA cerca di risolvere in autonomia compiti difficili", per un uso prolungato di strumenti invece che per la conversazione. La famiglia è ritagliata sui footprint NVIDIA più comuni: Nano (30B) per hardware consumer, Super (120B) e Ultra ai vertici delle dimensioni.

La reazione si è divisa come prevedibile. Gli sviluppatori hanno apprezzato l'economia: un test iniziale aveva fatto svolgere a Ultra un compito ad alto contenuto di fisica per circa 5 centesimi, contro circa 57 centesimi di un modello chiuso comparabile, circa 10 volte più economico, ed è arrivato gratuitamente il primo giorno su OpenCode e OpenRouter. Gli scettici, come la recensione dell'harness di Fluid Coding, hanno posto la domanda giusta: una tabella di benchmark solida non è la stessa cosa che restare coerenti in un vero ciclo di agente di coding con strumenti, log rotti e una memoria che copre 10 passaggi. I confronti diretti su r/LocalLLaMA sono già in corso.

03. Perché ci prestiamo attenzione

Un modello open-weight focalizzato sugli agenti e di dimensioni al vertice, che gira velocemente su hardware NVIDIA già posseduto da molti nostri clienti, è un'opzione rilevante per l'IA on-premise. Pesi aperti più alto throughput più un contesto di un milione di token è la combinazione che rende impiegabili agenti autonomi a lungo termine nell'ambiente proprio di un cliente: nessuna fattura per token verso un fornitore, nessun dato che lascia l'azienda.

Come sempre, la prova sta nell'harness, non nella classifica. Ma Nemotron 3 sposta l'IA agentica self-hosted da possibile a praticabile.

← Signals

Wayne Dyer

“Se cambiate il modo in cui guardate le cose, le cose che guardate cambiano.”