La Retrieval-Augmented Generation, e perché sostiene un'IA sovrana
Il RAG ancora le risposte di un modello a fonti recuperate e riduce allucinazioni e obsolescenza. Perché sostiene un'IA sovrana.
Aggiornato al aprile 2024. I dati su modelli, prezzi e benchmark possono essere nel frattempo superati. Traduzione generata automaticamente con IA. La versione tedesca è l'originale verificato dalla redazione.
Un modello linguistico da solo risponde a partire da dati di addestramento congelati, e così finisce per essere sicuro di sé e sbagliato. La Retrieval-Augmented Generation (RAG) affronta questo problema: recupera prima fonti rilevanti e aggiornate, poi genera la risposta a partire da esse. Per noi è la spina dorsale della maggior parte dei sistemi di IA utili e affidabili.
01. Che cos'è il RAG
Il RAG è un framework ibrido che accoppia un modello generativo con un sistema di retrieval. Invece di affidarsi solo a ciò che il modello ha appreso durante l'addestramento, al momento della risposta attinge a informazioni esterne.
Funziona in due passaggi. Retrieval: per una domanda, il sistema cerca in una base di conoscenza i passaggi più rilevanti. Generazione: il modello redige quindi una risposta naturale, ancorata a questi passaggi. La risposta si legge in modo colloquiale, ma è vincolata a fonti reali invece che alla memoria del modello.
02. Perché conta
- Ancoraggio ai fatti. Ottenere le risposte da fonti verificate riduce gli errori sicuri di sé e plausibili che i modelli non ancorati tendono a produrre.
- Conoscenza aggiornata. Il retriever può leggere dati in tempo reale, così le risposte non invecchiano come pesi di addestramento fissi.
- Adattabile tra i vari settori. Potete orientarlo verso una base di conoscenza di supporto, un corpus di ricerca o documenti interni, e lo stesso approccio si adatta a supporto, ricerca, sanità o istruzione.
Per un'introduzione più approfondita, la spiegazione del RAG di NVIDIA è un buon punto di partenza.
03. Perché sostiene un'IA sovrana
Il RAG è il punto in cui capacità e controllo si incontrano. La conoscenza risiede in una memoria che vi appartiene, il modello può funzionare nel vostro stesso ambiente, e la risposta è ancorata ai vostri dati, che non devono mai lasciarvi. È lo stesso punto che sosteniamo riguardo ai modelli open-weight: la capacità che potete ospitare è la capacità che controllate.
Per un team che sta valutando dove far vivere la propria IA, il RAG è spesso la prima decisione di progettazione che rende un sistema self-hosted davvero utile invece che una semplice demo.

