LLM subquadratici: contesto lungo a costi inferiori per il RAG on-premise
I modelli subquadratici riducono i costi del contesto lungo. Una leva reale per il RAG on-premise, ma ancora giovane.
Traduzione generata automaticamente con IA. La versione tedesca è l'originale verificato dalla redazione.
I modelli subquadratici sono una leva concreta per l'economia del contesto lungo sull'hardware proprio. Una memoria limitata per la cache chiave-valore e un throughput da due a tre volte superiore con input lunghi sono fisica, non marketing. Ma nel 2026 il valore per il RAG delle PMI tedesche deriva ancora prevalentemente dalla qualità del retrieval e da un modello solido e ben supportato, non dalla scommessa su un'architettura giovane.
Questo testo spiega perché il contesto lungo è costoso, quali approcci subquadratici esistono, che cosa delle promesse più clamorose è dimostrato, e che cosa comporta concretamente per il RAG on-premise. La raccomandazione finale non è spettacolare, ed è proprio per questo sostenibile.
01. Perché il contesto lungo è costoso
Il motivo sta nella matematica dell'auto-attenzione: il suo costo cresce in modo quadratico con la lunghezza dell'input.
In un Transformer classico ogni token viene confrontato con ogni altro. Se la lunghezza del contesto raddoppia, il costo computazionale dell'attenzione si quadruplica all'incirca. A questo si aggiunge la memoria: la cache chiave-valore che il modello porta con sé durante la generazione cresce in modo lineare con la lunghezza e su una GPU fissa consuma rapidamente la memoria disponibile. Questo è il vero collo di bottiglia nell'esercizio on-premise, dove l'hardware è dato e non si può affittare in modo elastico.
È esattamente qui che intervengono gli approcci subquadratici. Cercano di spingere il costo della sequenza verso la linearità, quindi O(n) invece di O(n al quadrato), e di limitare la memoria per token. Che cosa questo significhi per la realtà hardware in azienda lo abbiamo calcolato in LLM locale.
02. Il panorama subquadratico
Esistono diverse strade, e il vincitore pratico degli anni dal 2024 al 2026 non è il più puro, bensì l'ibrido.
- Modelli a spazio di stato (Mamba). Mamba (dicembre 2023) e Mamba-2 (maggio 2024) modellano le sequenze in tempo lineare con una memoria di stato fissa invece di una cache crescente (arXiv). Il prezzo: uno stato fisso è un compressore con perdita ed è più debole nel ricordo esatto di punti molto lontani nel testo.
- Attenzione lineare (RWKV, RetNet). Riformulano l'attenzione in modo che il costo cresca in modo pressoché lineare. Compromesso simile sulla memoria associativa.
- Ibridi in produzione. Nessuno rilascia modelli puramente subquadratici di qualità di punta. Tutti mescolano invece una minoranza di livelli ad attenzione piena con una maggioranza di livelli a spazio di stato o lineari: Jamba (AI21, 2024), MiniMax-01 (gennaio 2025), Falcon-H1 (maggio 2025), Nemotron-H di NVIDIA, IBM Granite 4.0 (ottobre 2025) e Qwen3-Next (settembre 2025). I livelli pieni preservano la memoria, quelli snelli comprano il vantaggio in termini di costi e memoria.
La linea NVIDIA dietro Nemotron, che usa esattamente questa struttura ibrida, l'abbiamo descritta in Nemotron 3.
03. Che cosa promette il 'subQ' e che cosa di questo è dimostrato
Il termine richiede cautela, perché porta due significati, uno architetturale e uno di marketing.
Accanto alla famiglia subquadratica generale esiste un prodotto concreto: la start-up Subquadratic è uscita dall'ombra nel maggio 2026 con un finanziamento di circa 29 milioni di dollari e pubblicizza un'attenzione subquadratica e sparsa. I titoli sono altisonanti: un modello di ricerca con 12 milioni di token di contesto, circa un quinto dei costi rispetto ai modelli di punta, un throughput più volte superiore (The New Stack).
La valutazione onesta: una parte è verificata da terzi, ad esempio un risultato RULER-128K, mentre le cifre spettacolari sui 12 milioni di token e sul fattore di velocità sono dichiarazioni del fornitore da singole esecuzioni e non riprodotte in modo indipendente. È un indizio promettente, non una base per gli acquisti. Proprio questa distinzione, dimostrato contro dichiarato, è la disciplina che applichiamo a ogni nuovo modello.
04. Che cosa comporta per il RAG on-premise
Il vantaggio concreto è memoria e throughput su hardware fisso, ed è esattamente la leva giusta per il RAG on-premise.
- Cache limitata, memoria pianificabile. I livelli a spazio di stato portano uno stato fisso, quindi la memoria non esplode con la lunghezza. IBM dichiara per Granite 4.0 oltre il 70 % in meno di fabbisogno con contesto lungo, un dato del produttore, ma plausibile e nella direzione di più sessioni simultanee per GPU.
- Modello e contesto su una scheda. NVIDIA riporta che un modello Nemotron-H da 51 miliardi di parametri, cache inclusa, entra in una singola scheda da 80 GB, anche questo un dato del produttore.
- Disciplina di chunking più rilassata. Un contesto più economico consente finestre più grandi e un taglio dei documenti meno ansioso.
Le riserve oneste ci stanno. Nel RAG a forte carico di memoria, ad esempio il riferimento esatto su testi molto lunghi, i modelli puramente subquadratici restano ancora indietro rispetto all'attenzione piena, gli ibridi colmano il divario in gran parte ma non del tutto. L'ecosistema degli strumenti, quindi quantizzazione, serving e fine-tuning, è ancora indietro rispetto ai modelli densi affermati. E la frase più importante: contesto lungo non equivale a buon retrieval. Un modello solido con un buon RAG oggi batte quasi sempre il tentativo di riversare semplicemente milioni di token. Che cosa faccia esattamente il RAG è spiegato in Che cos'è il RAG e Il potere del RAG.
05. Come lo tratto oggi
Il subquadratico merita di essere osservato, ma non merita una scommessa. Ecco come lo tratto:
- Costruire il livello RAG in modo indipendente dal modello. Dietro un'interfaccia stabile, così da poter inserire un ibrido della classe Granite 4 non appena l'ecosistema degli strumenti sarà maturo.
- Partire con un modello solido e ben supportato, non con l'architettura più recente, e ricavare il valore dalla qualità del retrieval.
- Ignorare le promesse non dimostrate. Un fattore mille dichiarato aspetta finché qualcuno di indipendente non lo riproduce.
È lo stesso schema che applichiamo nel confronto tra on-premise e cloud: decidere consapevolmente, costruire in modo sostituibile (On-Premise vs. Cloud-LLM). La domanda interessante non è se i modelli subquadratici renderanno un giorno il contesto lungo economico. Probabilmente lo faranno. La domanda è se la vostra architettura sia pronta a coglierne il vantaggio, senza scommetterci oggi. Il vostro livello RAG è costruito in modo tale che possiate sostituire il modello senza dover riscrivere tutto?

