F-RAG (RAG-Fusion): czym różni się od zwykłego RAG
RAG-Fusion wykonuje kilka wariantów zapytania i łączy wyniki metodą Reciprocal Rank Fusion. Lepszy recall, pewne ryzyko dryfu.
Tłumaczenie wygenerowane automatycznie przez AI. Wersja niemiecka jest oryginałem zweryfikowanym redakcyjnie.
F-RAG, w skrócie od RAG-Fusion, różni się od zwykłego RAG w jednym kroku: zamiast wyszukiwać na podstawie Państwa pojedynczego zapytania, tworzy kilka jego przeformułowań, dla każdego wykonuje wyszukiwanie, a następnie łączy wyniki metodą Reciprocal Rank Fusion (RAG-Fusion-Paper). Chodzi o recall. Jedno sformułowanie pomija fragmenty, które nieco inne sformułowanie by wychwyciło. Jeśli retrieval jest dla Państwa nowym tematem, proszę zacząć od tego, czym jest RAG; niniejszy artykuł jest rozwinięciem tego tematu.
01. MECHANIZM, W SKRÓCIE
Zwykły RAG osadza (embeduje) Państwa zapytanie, znajduje najbliższe fragmenty i na ich podstawie odpowiada. RAG-Fusion dodaje przed tym dwa kroki. Po pierwsze, model zapisuje garść alternatywnych zapytań, które oznaczają to samo z różnych perspektyw. Po drugie, wykonuje wyszukiwanie dla wszystkich i łączy uszeregowane listy metodą Reciprocal Rank Fusion, która nagradza fragmenty dobrze rankingowane w kilku zapytaniach, a nie tylko w jednym. Odpowiedź jest następnie pisana na podstawie tego połączonego, przeszeregowanego zbioru.
02. DLACZEGO KROK FUZJI SIĘ LICZY
Pojedyncze zapytanie to pojedyncza hipoteza co do tego, jak odpowiedź jest sformułowana w Państwa dokumentach. Prawdziwe archiwa używają synonimów, skrótów i różnych sformułowań dla tej samej rzeczy. Zadając pytanie wielokrotnie i nagradzając to, co konsekwentnie zajmuje wysokie miejsce, RAG-Fusion wydobywa na wierzch fragment, który pojedyncze sformułowanie by pominęło. Reciprocal Rank Fusion jest tu cichym koniem pociągowym: łączy listy bez potrzeby porównywalnych wyników (score), dlatego pojawia się także w architekturach hybrydowych i late-interaction, takich jak te stojące za Qdrant i ColQwen.
03. KIEDY POMAGA, A KIEDY SZKODZI
RAG-Fusion zarabia na swój koszt przy pytaniach niejednoznacznych lub obciążonych terminologią, gdzie jedno sformułowanie jest słabym zakładem. Kosztuje więcej: kilka wyszukiwań i jeden krok generowania na pytanie, więc nie jest to darmowe opóźnienie (latencja). Ma też realny wzorzec błędu. Jeśli wygenerowane warianty zapytania odbiegają od tego, co Państwo faktycznie mieli na myśli, wciągają fragmenty niezwiązane z tematem i odpowiedź zaczyna dryfować. Środkiem zaradczym jest trzymanie generowanych zapytań blisko pierwotnej intencji oraz mierzenie, a nie zakładanie, że recall wzrósł.
04. GDZIE PLASUJE SIĘ WŚRÓD OPCJI
RAG-Fusion to jeden z kilku sposobów na poprawienie retrievalu, a nie zamiennik dobrego retrievalu. Zanim Państwo po niego sięgną, proszę upewnić się, że podstawy są solidne: czyste chunki, solidny model embeddingowy i magazyn wektorowy dopasowany do zadania. Dla dokumentów gęstych wizualnie większą dźwignią jest często retrieval wizualny, a nie kolejne warianty zapytania. Proszę stosować F-RAG tam, gdzie pytanie jest naprawdę niejednoznaczne, a zysk w recall jest wart dodatkowych wywołań.

