Recherche · 5 MIN

LLM subquadratiques : un contexte long moins cher pour le RAG on-prem

Les modèles subquadratiques réduisent le coût du contexte long. Un vrai levier pour le RAG on-prem, mais encore jeune.

LLM subquadratiques : un contexte long moins cher pour le RAG on-prem
LIEU
Allemagne
AUTEUR
Aashwin Shrivastava
PUBLIÉ LE
18 juin 2026

Traduction produite automatiquement par IA. La version allemande est l'original vérifié par la rédaction.

Les modèles subquadratiques sont un vrai levier pour l'économie du contexte long sur son propre matériel. Une mémoire limitée pour le cache clé-valeur et un débit deux à trois fois supérieur sur les longues entrées relèvent de la physique, pas du marketing. Mais en 2026, la valeur pour le RAG de PME vient encore majoritairement de la qualité du retrieval et d'un modèle solide et bien pris en charge, pas du pari sur une architecture jeune.

Ce texte explique pourquoi le contexte long est coûteux, quelles approches subquadratiques existent, ce qui est étayé parmi les promesses les plus tapageuses, et ce que cela apporte concrètement au RAG on-prem. La recommandation finale est peu spectaculaire et c'est précisément pourquoi elle est solide.

01. Pourquoi le contexte long est coûteux

La raison tient aux mathématiques de l'auto-attention : son effort croît quadratiquement avec la longueur de l'entrée.

Dans un transformeur classique, chaque token compare chaque autre. Si la longueur de contexte double, l'effort de calcul de l'attention quadruple grosso modo. S'y ajoute la mémoire : le cache clé-valeur que le modèle traîne pendant la génération croît linéairement avec la longueur et dévore vite la mémoire disponible sur un GPU fixe. C'est le véritable goulet d'étranglement en exploitation on-prem, où le matériel est acté et non loué de façon élastique.

C'est précisément là qu'agissent les approches subquadratiques. Elles tentent de pousser le coût de séquence vers le linéaire, donc O(n) au lieu de O(n au carré), et de limiter la mémoire par token. Ce que cela signifie pour la réalité matérielle en entreprise, nous l'avons calculé dans LLM local.

02. Le paysage subquadratique

Il y a plusieurs voies, et le vainqueur pratique des années 2024 à 2026 n'est pas la plus pure, mais l'hybride.

  • Modèles à espace d'états (Mamba). Mamba (décembre 2023) et Mamba-2 (mai 2024) modélisent les séquences en temps linéaire avec une mémoire d'état fixe plutôt qu'un cache croissant (arXiv). Le prix : un état fixe est un compresseur avec perte et plus faible pour se souvenir exactement d'endroits très en arrière.
  • Attention linéaire (RWKV, RetNet). Reformulent l'attention pour que le coût croisse à peu près linéairement. Compromis similaire sur la mémoire associative.
  • Hybrides en production. Personne ne livre de modèles purement subquadratiques de qualité de pointe. Au lieu de cela, tous mélangent une minorité de couches à attention pleine avec une majorité de couches à espace d'états ou linéaires : Jamba (AI21, 2024), MiniMax-01 (janvier 2025), Falcon-H1 (mai 2025), Nemotron-H de NVIDIA, IBM Granite 4.0 (octobre 2025) et Qwen3-Next (septembre 2025). Les couches pleines préservent la mémoire, les couches légères achètent l'avantage en coût et en mémoire.

La lignée NVIDIA derrière Nemotron, qui utilise précisément cette architecture hybride, nous l'avons décrite dans Nemotron 3.

03. Ce que « subQ » promet, et ce qui en est étayé

Le terme exige de la prudence, car il porte deux sens, un architectural et un marketé.

Outre la famille subquadratique générale, il existe un produit concret : la start-up Subquadratic est sortie de l'ombre en mai 2026 avec un financement d'environ 29 millions de dollars et se prévaut d'une attention subquadratique et parcimonieuse. Les titres sont énormes : un modèle de recherche à 12 millions de tokens de contexte, environ un cinquième du coût par rapport aux modèles de pointe, une vitesse démultipliée (The New Stack).

L'appréciation honnête : une partie est vérifiée par des tiers, par exemple un résultat RULER-128K, tandis que les chiffres spectaculaires sur 12 millions de tokens et le facteur de vitesse sont des données du fournisseur issues de passages isolés et non reproduites de façon indépendante. C'est un indice prometteur, pas une base d'achat. C'est précisément cette distinction, étayé contre affirmé, qui est la discipline que nous appliquons à chaque nouveau modèle.

04. Ce que cela apporte au RAG on-prem

Le gain concret est de la mémoire et du débit sur du matériel fixe, et c'est pour le RAG on-prem exactement le bon réglage.

  • Cache limité, mémoire prévisible. Les couches à espace d'états portent un état fixe, la mémoire n'explose donc pas avec la longueur. IBM annonce pour Granite 4.0 plus de 70 pour cent de besoin en moins sur contexte long, une donnée du fournisseur, mais plausible et allant dans le sens de plus de sessions simultanées par GPU.
  • Modèle et contexte sur une seule carte. NVIDIA rapporte qu'un modèle Nemotron-H de 51 milliards de paramètres tient avec son cache sur une seule carte de 80 Go, également une donnée du fournisseur.
  • Discipline de chunking plus souple. Un contexte moins cher permet des fenêtres plus grandes et un découpage moins craintif des documents.

Des réserves honnêtes s'imposent. Pour le RAG à forte charge mémorielle, par exemple la fundstelle exacte sur des textes très longs, les modèles purement subquadratiques restent en deçà de l'attention pleine, les hybrides comblent largement l'écart, mais pas entièrement. L'écosystème d'outillage, donc quantisation, serving et fine-tuning, est en retard sur les modèles denses établis. Et la phrase la plus importante : contexte long n'est pas égal à bon retrieval. Un modèle solide avec un bon RAG bat aujourd'hui presque toujours la tentative de simplement y déverser des millions de tokens. Ce que le RAG apporte tout court, c'est dans Qu'est-ce que le RAG et La force du RAG.

05. Comment je traite cela aujourd'hui

Subquadratique vaut la peine d'être observé, mais pas le pari. Voici comment je m'y prends :

  1. Construire la couche RAG indépendamment du modèle. Derrière une interface stable, de sorte qu'un hybride de classe Granite 4 puisse être déployé dès que l'outillage est mûr.
  2. Démarrer avec un modèle solide et bien pris en charge, pas avec l'architecture la plus récente, et tirer la valeur de la qualité du retrieval.
  3. Ignorer les promesses non étayées. Un facteur revendiqué de mille attend que quelqu'un d'indépendant le reproduise.

C'est le même schéma que nous tirons pour On-Premise contre cloud : décider à dessein, construire remplaçable (On-Premise contre LLM cloud). La question captivante n'est pas de savoir si les modèles subquadratiques rendront un jour le contexte long bon marché. Ils le feront probablement. La question est de savoir si votre architecture est prête à en tirer le gain, sans que vous pariiez dessus aujourd'hui. Votre couche RAG est-elle construite de sorte à pouvoir changer de modèle sans tout réécrire ?

← Signals

Wayne Dyer

“Si vous changez votre façon de voir les choses, les choses que vous voyez changent.”