Query-Zerlegung und der Advanced-RAG-Werkzeugkasten: passen Sie die Methode zum Versagen
Query-Zerlegung, HyDE, RAG-Fusion, GraphRAG beheben je ein Versagen. Das ausgefeilte RAG 2026 weiß, wann es keines nutzt.
Die Advanced-RAG-Techniken sind keine Reifeleiter, die man erklimmt. Sie sind ein Diagnose-Werkzeugkasten, indiziert nach dem Versagen, das Sie tatsächlich beobachten. Query-Zerlegung behebt Multi-Hop-Fragen. HyDE behebt Vokabular-Fehlpassung. GraphRAG beantwortet korpusweite Fragen, die gar nicht wirklich Retrieval sind. All das auf jede Anfrage zu stapeln, vervielfacht Ihre Kosten und Latenz für Anfragen, die die Hilfe nie brauchten. Das ausgefeilte System 2026 ist nicht das mit den meisten Techniken; es ist das, das weiß, wann es keine davon nutzt.
01. Beginnen Sie am Boden, nicht an der Decke
Vor jeder cleveren Methode bringen Sie die Basis in Ordnung, denn sie behebt die meisten Klagen. Der Produktionsstandard 2026 ist hybride Suche (dichte Embeddings plus Keyword-BM25), gefolgt von einem Cross-Encoder-Reranker. Hybride Suche fängt sowohl semantische als auch exakte Termtreffer; der Reranker bewertet einen großen Kandidatensatz auf die wenigen Passagen herunter, die tatsächlich relevant sind, nicht bloß thematisch nah. Praktiker-Leitfäden berichten, dass diese Kombination die Retrieval-Qualität auf Standard-Evaluierungssätzen um 15 bis 30 Prozent hebt.
Das zählt, weil die meisten realen Fehler die einfache Art sind: die Antwort stand in den Dokumenten, aber das System brachte sie nicht zum Vorschein. Das ist ein Recall- und Ranking-Problem, und der Boden oben behebt es. Beweisen Sie, dass Sie mehr brauchen, bevor Sie mehr bauen. Jede Technik jenseits dieses Punktes fügt LLM-Aufrufe, Latenz und Kosten hinzu, jede sollte sich ihren Platz gegen ein gemessenes Versagen verdienen, nicht gegen ein Bauchgefühl.
02. Der Werkzeugkasten, indiziert nach dem Versagen, das er behebt
Der nützliche Weg, den ganzen Zoo der Methoden zu halten, ist, jede auf das einzelne Versagensmuster abzubilden, das sie adressiert. Greifen Sie zu einer Methode, wenn Sie ihr Versagen sehen, nicht vorher.
| Das Versagen, das Sie sehen | Die Methode, die es behebt |
|---|---|
| Mehrteilige oder Multi-Hop-Frage, Fakten über Dokumente verteilt | Query-Zerlegung in Teilfragen |
| Knappe oder mehrdeutige Anfrage, die schlecht einbettet | HyDE, Anfrage-Umschreibung |
| Eine Formulierung verfehlt relevante Passagen | RAG-Fusion (mehrere Anfragevarianten, verschmolzen) |
| Frage braucht zuerst ein allgemeines Prinzip | Step-Back-Prompting |
| Heterogene Korpora und Anfragetypen | Routing zum richtigen Index oder zur richtigen Pipeline |
| Harte strukturierte Randbedingungen (Daten, Typen) | Self-Querying (Metadaten-Filter) |
| Retrieval liefert still falsche Dokumente | Corrective RAG (ein Grader plus Rückfall) |
| Korpusweite globale Frage über alles | GraphRAG (Entitätsgraph plus Zusammenfassungen) |
Jede Zeile hat echte Herkunft: HyDE stammt aus einem CMU-Paper von 2022 zu Zero-Shot-Dense-Retrieval; Step-Back-Prompting von Google DeepMind, 2023; GraphRAG von Microsoft, 2024. Das ist dieselbe Entscheidung-nach-Versagen-Disziplin hinter unserem Blick auf RAG-Fusion und wie es sich von einfachem RAG unterscheidet.
03. Query-Zerlegung, im Speziellen
Query-Zerlegung teilt eine komplexe Anfrage in unabhängige Teilfragen, ruft für jede ab und synthetisiert dann eine Antwort. Es ist das richtige Werkzeug, wenn ein einzelner Retrieval-Durchgang nicht funktionieren kann, weil die Fakten in verschiedenen Dokumenten leben oder ein Fakt von einem anderen abhängt (wer den Film inszenierte, der einen bestimmten Preis gewann). Die Linie läuft vom Least-to-Most-Prompting 2022 zu den Teilfragen-Query-Engines der heutigen Frameworks.
Der ehrliche Teil ist, dass es nicht kostenlos ist und schaden kann. Eine Studie der HU Berlin vom Juli 2025 maß, dass Zerlegung plus Reranking den Multi-Hop-Recall (Hits@10) von 74,7 auf 87,2 Prozent hob, ein echter Gewinn. Dieselbe Studie maß die Kosten: rund 16,7 Sekunden je Anfrage gegen 0,03 Sekunden für naives Retrieval, und sie fand, dass das Zerlegen einer bereits spezifischen Anfrage Rauschen einführt und die Antwort schlechter macht. Zerlegung gehört also auf wirklich Multi-Hop-Fragen, nicht standardmäßig auf jede Anfrage. Die Kunst ist, die beiden auseinanderzuhalten.
04. Der Hebel, der sich selbst bezahlt, ist Routing
Wenn Sie eine operative Idee hieraus mitnehmen, machen Sie es Routing. Klassifizieren Sie die Anfrage zuerst, dann geben Sie Komplexität nur dort aus, wo sie verdient ist. Eine Analyse von 2026 zu kostenbewusstem Routing senkte abgerechnete Token um 26 Prozent und die mittlere Latenz um 34 Prozent bei gleicher Antwortqualität, indem nur rund 18 Prozent der Anfragen an schweres Retrieval und 14 Prozent an gar kein Retrieval gingen. Die teuren Methoden blieben den Anfragen vorbehalten, die sie brauchten.
Für ein deutsches Mittelstandsteam ist das ebenso eine Governance- und Kostengeschichte wie eine Qualitätsgeschichte. Weniger, gerechtfertigte LLM-Aufrufe bedeuten planbare Ausgaben, geringere Latenz und ein System, das Sie einem compliance-orientierten Stakeholder erklären können: hier ist, warum diese Anfrage den teuren Weg nahm, und hier ist, warum jene ihn nicht nahm. Überengineertes Retrieval ist nicht nur langsam, es ist unerklärbare Ausgabe. Das ausgefeilte RAG-System 2026 ist das, das weiß, wann es keinen seiner Tricks nutzt.
Dazu arbeiten wir

