Nemotron 3: los modelos abiertos de NVIDIA creados para agentes
Nemotron 3 Ultra de NVIDIA: pesos abiertos de 550B, enfocado en agentes, fuerte en el índice, gratis desde el primer día. Una opción on-prem real.
Traducción generada automáticamente con IA. La versión alemana es el original revisado por la redacción.
Un modelo open-weight a escala frontera, creado para agentes de larga duración en lugar de chat, que funciona rápido en hardware de NVIDIA que muchos clientes ya poseen. Eso es lo que convierte a Nemotron 3 en una opción on-prem real. NVIDIA completó la familia en Computex con Nemotron 3 Ultra, un modelo Mixture-of-Experts de 550 mil millones de parámetros (55B activos), publicado el 4 de junio bajo la licencia Open MDW de la Linux Foundation.
01. Fuerte en el índice, interesante bajo el capó
Según Artificial Analysis, Ultra obtiene 47,7 en su Intelligence Index, el modelo de pesos abiertos estadounidense más fuerte, por delante de Gemma 4 31B (39,2) y del más pequeño Nemotron 3 Super (36,0).
El informe técnico detalla lo interesante: un MoE híbrido Mamba-Attention con LatentMoE, entrenamiento NVFP4 y capas de predicción multitoken para decodificación especulativa nativa, hasta 5 veces más rendimiento que la generación anterior, con una ventana de contexto de hasta 1M de tokens.
02. Creado para agentes, no para chat
NVIDIA fue explícita en el lanzamiento: Nemotron 3 es para \"problemas agénticos en los que una IA intenta resolver tareas difíciles de forma autónoma\", uso de herramientas de larga duración en lugar de conversación. La familia está dimensionada para las huellas comunes de NVIDIA: Nano (30B) para hardware de consumo, Super (120B) y Ultra a escala frontera.
La reacción se dividió de forma previsible. A los desarrolladores les gustó la economía: una prueba temprana tuvo a Ultra completando una tarea con mucha física por unos 5 céntimos frente a unos 57 céntimos en un modelo cerrado comparable, unas 10 veces más barato, y aterrizó gratis en OpenCode y OpenRouter el primer día. Los escépticos, como la reseña de harness de Fluid Coding, plantearon la pregunta correcta: una tabla de benchmarks fuerte no es lo mismo que mantenerse coherente a lo largo de un bucle real de agente de programación con herramientas, registros rotos y memoria de 10 turnos. Los enfrentamientos directos en r/LocalLLaMA ya están en marcha.
03. Por qué le prestamos atención
Un modelo a escala frontera, open-weight y enfocado en agentes que funciona rápido en hardware de NVIDIA que muchos de nuestros clientes ya poseen es una opción significativa para la IA on-prem. Pesos abiertos más alto rendimiento más un contexto de un millón de tokens es la combinación que hace desplegables los agentes autónomos de larga duración dentro del propio entorno de un cliente: sin factura por token del proveedor, sin que los datos salgan del edificio.
Como siempre, la prueba está en el harness, no en la tabla de clasificación. Pero Nemotron 3 lleva la IA agéntica autoalojada de lo posible a lo práctico.

