Nemotron 3: otwarte modele NVIDII zbudowane dla agentów
Nemotron 3 Ultra od NVIDII: 550B otwartych wag, zorientowany na agentów, silny w rankingach, wolny od pierwszego dnia. Prawdziwa opcja On-Prem.
Tłumaczenie wygenerowane automatycznie przez AI. Wersja niemiecka jest oryginałem zweryfikowanym redakcyjnie.
Model najwyższej klasy z otwartymi wagami, zbudowany z myślą o długo działających agentach, a nie o czacie, który szybko działa na sprzęcie NVIDIA już posiadanym przez wielu klientów. To właśnie czyni Nemotron 3 prawdziwą opcją on-prem. NVIDIA uzupełniła rodzinę modeli na targach Computex modelem Nemotron 3 Ultra, modelem typu Mixture-of-Experts z 550 miliardami parametrów (55B aktywnych), wydanym 4 czerwca na licencji Open MDW fundacji Linux Foundation.
01. Silny w rankingu, interesujący pod maską
Według Artificial Analysis Ultra osiąga 47,7 punktu w swoim Intelligence Index, co czyni go najsilniejszym amerykańskim modelem z otwartymi wagami, przed Gemma 4 31B (39,2) i mniejszym Nemotron 3 Super (36,0).
Raport techniczny opisuje ciekawszą część: hybrydowy model Mamba-Attention-MoE z LatentMoE, trening NVFP4 oraz warstwy Multi-Token-Prediction dla natywnego dekodowania spekulacyjnego, przepustowość nawet 5 razy wyższą niż w poprzedniej generacji, z oknem kontekstu do 1 mln tokenów.
02. Zbudowany dla agentów, nie dla czatu
NVIDIA jasno określiła to podczas premiery: Nemotron 3 jest przeznaczony do "problemów agentowych, w których AI próbuje autonomicznie rozwiązywać trudne zadania", długotrwałego korzystania z narzędzi zamiast konwersacji. Rodzina modeli jest dopasowana do typowych konfiguracji sprzętowych NVIDIA: Nano (30B) na sprzęt konsumencki, Super (120B) oraz Ultra najwyższej klasy.
Reakcje podzieliły się w oczekiwany sposób. Deweloperzy docenili ekonomię: wczesny test wykazał, że Ultra wykonał zadanie mocno związane z fizyką za około 5 centów, wobec około 57 centów w przypadku porównywalnego modelu zamkniętego, czyli około 10 razy taniej, a już pierwszego dnia był dostępny bezpłatnie na OpenCode i OpenRouter. Sceptycy, tacy jak recenzja harnessu Fluid Codings, zadali właściwe pytanie: mocna tabela benchmarków to nie to samo, co zachowanie spójności w prawdziwej pętli agenta kodującego, z narzędziami, uszkodzonymi logami i pamięcią obejmującą 10 kroków. Bezpośrednie porównania na r/LocalLLaMA już trwają.
03. Dlaczego zwracamy na to uwagę
Skoncentrowany na agentach model z otwartymi wagami najwyższej klasy, który szybko działa na sprzęcie NVIDIA już posiadanym przez wielu naszych klientów, jest istotną opcją dla AI on-prem. Otwarte wagi plus wysoka przepustowość plus kontekst miliona tokenów to kombinacja, która czyni długo działających autonomicznych agentów wdrażalnymi we własnym środowisku klienta: żadnych opłat za token wobec dostawcy, żadnych danych opuszczających firmę.
Jak zawsze dowód tkwi w harnessie, nie w rankingu. Ale Nemotron 3 przesuwa samodzielnie hostowaną AI agentową z możliwej do praktycznej.

