Che cos'è il RAG? La Retrieval-Augmented Generation spiegata alle PMI
Il RAG collega un modello linguistico ai vostri documenti, perché le risposte restino verificabili e aggiornate.
Traduzione generata automaticamente con IA. La versione tedesca è l'originale verificato dalla redazione.
La Retrieval-Augmented Generation, in breve RAG, collega un modello linguistico a una raccolta ricercabile dei vostri documenti. Invece di generare la risposta solo dalla conoscenza di addestramento, il sistema cerca prima i passaggi pertinenti nei vostri dati e formula la risposta a partire da questi. Per le PMI è il modo più pratico di applicare un modello linguistico al proprio sapere, senza riaddestrare un modello e senza che i documenti interni lascino la propria infrastruttura.
Questo articolo spiega che cos'è il RAG, come è strutturata una pipeline, perché il retriever conta spesso più della dimensione del modello e quando ne vale la pena.
01. Il problema che il RAG risolve
Un modello linguistico generico non conosce i vostri documenti interni. È stato addestrato su dati pubblici e termina a una data di cutoff. Se un dipendente chiede l'accordo di fornitura attuale con un determinato fornitore, il modello ha due possibilità: dire che non conosce la risposta, oppure inventarne una dal suono plausibile. La seconda possibilità è quella pericolosa.
Il RAG colma questa lacuna. Prima di ogni risposta il sistema cerca nelle vostre fonti, ad esempio contratti, manuali, ticket o un wiki, e passa al modello le sezioni rilevanti. Il modello formula quindi una risposta basata su questi passaggi concreti e può citarli. Da un modello che deve indovinare si passa a un sistema che consulta. Abbiamo descritto l'ulteriore beneficio aziendale in Discover the Potential of AI in Business.
02. Come funziona una pipeline RAG
Una pipeline RAG è composta da cinque passaggi che si separano nettamente l'uno dall'altro.
- Indicizzazione. I vostri documenti vengono suddivisi in piccole sezioni e tradotti in vettori numerici che ne rappresentano il significato. Questi vettori risiedono in un database vettoriale.
- Retrieval. Per una domanda il sistema calcola il vettore corrispondente e recupera dal database le sezioni più simili. Qui si decide la qualità della risposta successiva.
- Augmentazione. Le sezioni trovate vengono inserite insieme alla domanda nel prompt del modello.
- Generazione. Il modello formula la risposta a partire dal contesto fornito, non dalla propria memoria.
- Citazione delle fonti. Il sistema indica i documenti da cui proviene la risposta, in modo che una persona possa verificarli.
Importante è il terzo punto della separazione: potete sostituire il modello senza rielaborare i vostri dati, e potete aggiornare i vostri dati senza toccare il modello.
03. Perché il retriever conta spesso più della dimensione del modello
Nella pratica, la maggior parte dell'energia va nella scelta del modello. Secondo la nostra esperienza, la leva sta più spesso nel retrieval. Abbiamo posto la stessa domanda tecnica a un grande modello ospitato e a un modello locale più piccolo con un retriever accuratamente calibrato. Sulle domande univoche entrambi erano alla pari. Nei casi ambigui, cioè la minoranza che conta davvero, era la qualità del retrieval a decidere la risposta utilizzabile, non la dimensione del modello.
Il motivo è semplice: un modello più grande formula una risposta sbagliata solo in modo più eloquente, se gli manca la sezione corretta. Un retriever ben calibrato fornisce invece il passaggio giusto, e allora basta un modello più piccolo. Abbiamo già descritto la stessa osservazione in modo più approfondito nel nostro precedente articolo sulla Retrieval-Augmented Generation.
04. RAG, protezione dei dati e il caso on-premise
Il RAG si adatta bene a un'architettura attenta alla protezione dei dati, perché tutti i componenti possono essere gestiti in casa. Retriever, database vettoriale e modello possono girare on-premise, cosicché né la domanda né i documenti trovati vengono inviati a un servizio esterno. Per le aziende che lavorano con dati personali, contratti o documentazione di progettazione, questo è spesso il presupposto perché un progetto possa partire.
Quale modello sia adatto all'esercizio locale e con quale hardware lo trattiamo in LLM locale in azienda: hardware, costi, realtà. Il bilanciamento di fondo tra esercizio locale e cloud si trova in On-premise contro LLM cloud: quando l'IA locale è la scelta giusta.
05. Quando il RAG conviene e quando no
Il RAG conviene quando il vostro sapere risiede in documenti, cambia regolarmente e viene interrogato da molte persone. I casi tipici sono basi di conoscenza interne, il supporto, la verifica delle offerte e la ricerca nella documentazione tecnica.
Il RAG conviene meno quando la risposta è un calcolo esatto tratto da un database, perché per questo una query classica è più precisa. Non sostituisce nemmeno una manutenzione pulita dei dati: se i documenti sorgente sono contraddittori o obsoleti, anche un buon retrieval produce risposte contraddittorie. Il primo passo di un progetto RAG è quindi di solito l'esame onesto del sapere esistente, non la scelta del modello.

