Nemotron 3: NVIDIAs offene, für Agenten gebaute Modelle
NVIDIAs Nemotron 3 Ultra: 550B offene Gewichte, agentenfokussiert, stark im Index, ab Tag eins frei. Eine echte On-Prem-Option.
Ein Modell auf Spitzengröße mit offenen Gewichten, für langlaufende Agenten statt Chat gebaut, das schnell auf NVIDIA-Hardware läuft, die viele Kunden bereits besitzen. Das macht Nemotron 3 zu einer echten On-Prem-Option. NVIDIA vervollständigte die Familie auf der Computex mit Nemotron 3 Ultra, einem Mixture-of-Experts-Modell mit 550 Milliarden Parametern (55B aktiv), veröffentlicht am 4. Juni unter der Open-MDW-Lizenz der Linux Foundation.
01. Stark im Index, interessant unter der Haube
Laut Artificial Analysis erreicht Ultra 47,7 auf seinem Intelligence Index, das stärkste US-Open-Weights-Modell, vor Gemma 4 31B (39,2) und dem kleineren Nemotron 3 Super (36,0).
Der technische Bericht beschreibt den interessanten Teil: ein hybrides Mamba-Attention-MoE mit LatentMoE, NVFP4-Training und Multi-Token-Prediction-Schichten für natives spekulatives Dekodieren, bis zu 5-mal höherer Durchsatz als die Vorgängergeneration, mit einem Kontextfenster von bis zu 1M Tokens.
02. Für Agenten gebaut, nicht für Chat
NVIDIA war beim Launch deutlich: Nemotron 3 ist für "agentische Probleme, bei denen eine KI versucht, schwierige Aufgaben autonom zu lösen", langlaufenden Werkzeugeinsatz statt Konversation. Die Familie ist auf gängige NVIDIA-Footprints zugeschnitten: Nano (30B) für Consumer-Hardware, Super (120B) und Ultra auf Spitzengröße.
Die Reaktion spaltete sich erwartbar. Entwickler mochten die Ökonomie: Ein früher Test hatte Ultra eine physiklastige Aufgabe für rund 5 Cent erledigen lassen, gegenüber etwa 57 Cent bei einem vergleichbaren geschlossenen Modell, rund 10-mal günstiger, und es landete an Tag eins frei auf OpenCode und OpenRouter. Die Skeptiker, wie Fluid Codings Harness-Review, stellten die richtige Frage: Eine starke Benchmark-Tabelle ist nicht dasselbe wie kohärent zu bleiben über eine echte Coding-Agent-Schleife mit Werkzeugen, kaputten Logs und einem Gedächtnis über 10 Züge. Die r/LocalLLaMA-Direktvergleiche sind bereits im Gange.
03. Warum wir aufmerksam sind
Ein agentenfokussiertes Open-Weight-Modell auf Spitzengröße, das schnell auf NVIDIA-Hardware läuft, die viele unserer Kunden bereits besitzen, ist eine bedeutsame Option für On-Prem-KI. Offene Gewichte plus hoher Durchsatz plus ein Kontext von einer Million Tokens ist die Kombination, die langlaufende autonome Agenten in der eigenen Umgebung eines Kunden einsetzbar macht: keine Rechnung pro Token an einen Anbieter, keine Daten, die das Haus verlassen.
Wie immer liegt der Beweis im Harness, nicht in der Rangliste. Aber Nemotron 3 bewegt selbst gehostete agentische KI von möglich zu praktikabel.
Dazu arbeiten wir

