Methodologie · 4 MIN

Query-decompositie en de advanced-RAG-gereedschapskist: pas de methode aan op het falen

Query-decompositie, HyDE, RAG-fusion, GraphRAG verhelpen elk een ander soort falen. Het verfijnde RAG van 2026 weet wanneer het er geen gebruikt.

Query-decompositie en de advanced-RAG-gereedschapskist: pas de methode aan op het falen
LOCATIE
Wereldwijd
AUTEUR
Sayan Sinha
GEPUBLICEERD
25 jun 2026
BEELD
AI-GEGENEREERD

Vertaling automatisch gegenereerd met AI. De Duitse versie is het redactioneel gecontroleerde origineel.

De advanced-RAG-technieken zijn geen volwassenheidsladder die u beklimt. Het is een diagnostische gereedschapskist, geindexeerd op het falen dat u daadwerkelijk waarneemt. Query-decompositie verhelpt multi-hop-vragen. HyDE verhelpt vocabulairemismatch. GraphRAG beantwoordt corpusbrede vragen die eigenlijk helemaal geen retrieval zijn. Dit allemaal stapelen op elke aanvraag vermenigvuldigt uw kosten en latentie voor aanvragen die de hulp nooit nodig hadden. Het verfijnde systeem van 2026 is niet dat met de meeste technieken; het is dat wat weet wanneer het er geen van gebruikt.

01. Begin op de bodem, niet aan het plafond

Voordat u een slimme methode toepast, brengt u de basis op orde, want die verhelpt de meeste klachten. De productiestandaard van 2026 is hybride zoeken (dense embeddings plus keyword-BM25), gevolgd door een cross-encoder-reranker. Hybride zoeken vangt zowel semantische als exacte termtreffers op; de reranker beoordeelt een grote kandidatenset terug tot de paar passages die daadwerkelijk relevant zijn, niet slechts thematisch verwant. Praktijkgidsen melden dat deze combinatie de retrievalkwaliteit op standaard-evaluatiesets met 15 tot 30 procent verhoogt.

Dat telt, omdat de meeste reele fouten van het eenvoudige soort zijn: het antwoord stond in de documenten, maar het systeem bracht het niet naar boven. Dat is een recall- en rankingprobleem, en de bovenstaande basis verhelpt het. Bewijs dat u meer nodig heeft voordat u meer bouwt. Elke techniek voorbij dit punt voegt LLM-aanroepen, latentie en kosten toe; elk moet zijn plaats verdienen tegenover een gemeten falen, niet tegenover een onderbuikgevoel.

02. De gereedschapskist, geïndexeerd op het falen dat hij verhelpt

De nuttige manier om de hele dierentuin aan methoden te behouden, is elke af te beelden op het specifieke faalpatroon dat ze adresseert. Grijp naar een methode wanneer u het falen ervan ziet, niet eerder.

Het falen dat u zietDe methode die het verhelpt
Meerdelige of multi-hop-vraag, feiten verspreid over documentenQuery-decompositie in deelvragen
Beknopte of dubbelzinnige aanvraag die slecht embedHyDE, query-herschrijving
Een formulering mist relevante passagesRAG-fusion (meerdere aanvraagvarianten, samengevoegd)
Vraag heeft eerst een algemeen principe nodigStep-back-prompting
Heterogene corpora en aanvraagtypenRouting naar de juiste index of pipeline
Harde gestructureerde randvoorwaarden (data, typen)Self-querying (metadatafilter)
Retrieval levert stilzwijgend verkeerde documentenCorrective RAG (een grader plus terugval)
Corpusbrede globale vraag over allesGraphRAG (entiteitsgraaf plus samenvattingen)

Elke regel heeft echte herkomst: HyDE komt uit een CMU-paper uit 2022 over zero-shot dense retrieval; step-back-prompting van Google DeepMind, 2023; GraphRAG van Microsoft, 2024. Dat is dezelfde beslis-na-falen-discipline achter onze blik op RAG-fusion en hoe het verschilt van eenvoudige RAG.

03. Query-decompositie, in het bijzonder

Query-decompositie splitst een complexe aanvraag in onafhankelijke deelvragen, haalt voor elk op en synthetiseert vervolgens een antwoord. Het is het juiste gereedschap wanneer een enkele retrievalronde niet kan werken, omdat de feiten in verschillende documenten leven of een feit van een ander afhangt (wie de film regisseerde die een bepaalde prijs won). De lijn loopt van least-to-most-prompting in 2022 naar de deelvraag-query-engines van de huidige frameworks.

Het eerlijke deel is dat het niet gratis is en schade kan aanrichten. Een studie van de HU Berlin uit juli 2025 mat dat decompositie plus reranking de multi-hop-recall (Hits@10) van 74,7 naar 87,2 procent tilde, een echte winst. Dezelfde studie mat de kosten: ongeveer 16,7 seconden per aanvraag tegenover 0,03 seconden voor naieve retrieval, en ontdekte dat het decomponeren van een reeds specifieke aanvraag ruis introduceert en het antwoord slechter maakt. Decompositie hoort dus bij echte multi-hop-vragen, niet standaard bij elke aanvraag. De kunst is die twee uit elkaar te houden.

04. De hefboom die zichzelf terugbetaalt is routing

Als u hier een operationeel inzicht uit meeneemt, maak er dan routing van. Classificeer de aanvraag eerst, en geef complexiteit alleen uit waar ze verdiend is. Een analyse uit 2026 over kostenbewust routing verlaagde afgerekende tokens met 26 procent en de mediane latentie met 34 procent bij gelijke antwoordkwaliteit, door slechts ongeveer 18 procent van de aanvragen naar zware retrieval en 14 procent naar helemaal geen retrieval te sturen. De dure methoden bleven voorbehouden aan de aanvragen die ze nodig hadden.

Voor een Duits mkb-team is dat evenzeer een governance- en kostenverhaal als een kwaliteitsverhaal. Minder, gerechtvaardigde LLM-aanroepen betekenen voorspelbare uitgaven, lagere latentie en een systeem dat u aan een compliance-gerichte stakeholder kunt uitleggen: hier is waarom deze aanvraag de dure weg nam, en hier is waarom die andere dat niet deed. Overengineerde retrieval is niet alleen traag, het is onverklaarbare uitvoer. Het verfijnde RAG-systeem van 2026 is dat wat weet wanneer het geen van zijn trucs gebruikt.

← Signals

Wayne Dyer

“Als u de manier waarop u naar dingen kijkt verandert, veranderen de dingen waar u naar kijkt.”