LLM subcuadráticos: contexto largo más barato para el RAG on-prem
Los modelos subcuadráticos bajan los costes del contexto largo. Una palanca real para el RAG on-prem, pero aún joven.
Traducción generada automáticamente con IA. La versión alemana es el original revisado por la redacción.
Los modelos subcuadráticos son una palanca real para la economía del contexto largo sobre hardware propio. Memoria limitada para la caché clave-valor y un rendimiento dos a tres veces mayor en entradas largas son física, no marketing. Pero en 2026 el valor para el RAG de pyme sigue viniendo en su mayor parte de la calidad del retrieval y de un modelo sólido y bien soportado, no de la apuesta a una arquitectura joven.
Este texto explica por qué el contexto largo es caro, qué enfoques subcuadráticos hay, qué de las promesas más ruidosas está acreditado, y qué aporta eso en concreto al RAG on-prem. La recomendación al final es poco espectacular y justamente por eso sostenible.
01. Por qué el contexto largo es caro
La razón está en la matemática de la autoatención: su esfuerzo crece cuadráticamente con la longitud de la entrada.
En un transformer clásico, cada token compara con cada otro. Si se duplica la longitud del contexto, se cuadruplica a grandes rasgos el esfuerzo de cómputo de la atención. A eso se suma la memoria: la caché clave-valor que el modelo arrastra durante la generación crece linealmente con la longitud y devora rápido la memoria disponible en una GPU fija. Ese es el verdadero cuello de botella en la operación on-prem, donde el hardware está fijado y no se alquila de forma elástica.
Justamente aquí aplican los enfoques subcuadráticos. Intentan empujar los costes de secuencia hacia lo lineal, es decir, O(n) en lugar de O(n al cuadrado), y limitar la memoria por token. Qué significa eso para la realidad del hardware en la empresa lo hemos calculado en LLM local.
02. El paisaje subcuadrático
Hay varios caminos, y el ganador práctico de los años 2024 a 2026 no es el más puro, sino el híbrido.
- Modelos de espacio de estados (Mamba). Mamba (diciembre de 2023) y Mamba-2 (mayo de 2024) modelan secuencias en tiempo lineal con una memoria de estado fija en lugar de una caché creciente (arXiv). El precio: un estado fijo es un compresor con pérdidas y más débil en el recuerdo exacto de puntos muy lejanos.
- Atención lineal (RWKV, RetNet). Reformulan la atención de modo que los costes crezcan aproximadamente lineal. Compromiso similar en la memoria asociativa.
- Híbridos en producción. Nadie entrega modelos subcuadráticos puros de calidad puntera. En su lugar, todos mezclan una minoría de capas de atención plena con una mayoría de capas de espacio de estados o lineales: Jamba (AI21, 2024), MiniMax-01 (enero de 2025), Falcon-H1 (mayo de 2025), Nemotron-H de NVIDIA, IBM Granite 4.0 (octubre de 2025) y Qwen3-Next (septiembre de 2025). Las capas plenas conservan la memoria, las esbeltas compran la ventaja de coste y memoria.
La línea de NVIDIA detrás de Nemotron, que usa justamente este montaje híbrido, la hemos descrito en Nemotron 3.
03. Qué promete 'subQ' y qué de ello está acreditado
El término exige cautela, porque lleva dos significados, uno arquitectónico y uno de marketing.
Junto a la familia subcuadrática general hay un producto concreto: la startup Subquadratic salió del anonimato en mayo de 2026 con una financiación de unos 29 millones de dólares y se promociona con una atención subcuadrática y dispersa. Los titulares son grandes: un modelo de investigación con 12 millones de tokens de contexto, alrededor de una quinta parte de los costes frente a los modelos punteros, un múltiplo de velocidad (The New Stack).
La clasificación honesta: una parte está verificada por terceros, por ejemplo un resultado RULER-128K, mientras que las cifras espectaculares de 12 millones de tokens y del factor de velocidad son en cambio datos del proveedor de ejecuciones aisladas y no reproducidos de forma independiente. Eso es un indicio prometedor, no una base de compra. Justamente esa separación, acreditado frente a afirmado, es la disciplina que aplicamos a cada nuevo modelo.
04. Qué aporta esto al RAG on-prem
La ganancia concreta es memoria y rendimiento sobre hardware fijo, y ese es para el RAG on-prem justamente el tornillo correcto.
- Caché limitada, memoria planificable. Las capas de espacio de estados portan un estado fijo, así que la memoria no explota con la longitud. IBM menciona para Granite 4.0 más de un 70 por ciento menos de necesidad con contexto largo, un dato del fabricante, pero plausible y en dirección a más sesiones simultáneas por GPU.
- Modelo y contexto en una tarjeta. NVIDIA reporta que un modelo Nemotron-H con 51 mil millones de parámetros junto con la caché cabe en una sola tarjeta de 80 GB, también un dato del fabricante.
- Disciplina de chunking más laxa. Un contexto más barato permite ventanas más grandes y un troceado de documentos menos temeroso.
Los reparos honestos pertenecen a esto. En RAG con carga de memoria, por ejemplo la fuente exacta a lo largo de textos muy largos, los modelos subcuadráticos puros aún quedan por detrás de la atención plena, los híbridos cierran la brecha en gran medida, pero no del todo. El entorno de herramientas, es decir, cuantización, serving y ajuste fino, va por detrás de los modelos densos establecidos. Y la frase más importante: contexto largo no es igual a buen retrieval. Un modelo sólido con buen RAG le gana hoy casi siempre al intento de simplemente volcar millones de tokens dentro. Qué aporta siquiera RAG está en Qué es RAG y La fuerza de RAG.
05. Cómo lo trato hoy
Subcuadrático merece observación, pero no una apuesta. Así lo manejo:
- Construir la capa RAG independiente del modelo. Tras una interfaz estable, de modo que se pueda emplear un híbrido de la clase Granite 4 en cuanto el entorno de herramientas esté maduro.
- Empezar con un modelo sólido y bien soportado, no con la última arquitectura, y sacar el valor de la calidad del retrieval.
- Ignorar las promesas no acreditadas. Un factor afirmado de mil espera hasta que alguien independiente lo reproduzca.
Ese es el mismo patrón que trazamos en On-Premise frente a Cloud: decidir de forma consciente, construir intercambiable (On-Premise vs. LLM en la nube). La pregunta emocionante no es si los modelos subcuadráticos abaratarán algún día el contexto largo. Probablemente lo harán. La pregunta es si vuestra arquitectura está lista para recoger la ganancia sin que apostéis hoy por ella. ¿Está vuestra capa RAG construida de modo que podáis cambiar el modelo sin reescribirlo todo?

