Serie

RAG-Architekturen

Retrieval-Augmented Generation von der Ingestion bis zur Antwort. Die Reihe behandelt Chunking, Embeddings, Vektorspeicher, Reranking und Evaluation als Architekturfragen, denn an ihnen entscheidet sich, ob eine Wissensdatenbank belastbare Antworten liefert oder plausible.

12 Beiträge

Antwortzeit eines KI-Assistenten: woraus sie sich zusammensetzt Antwortzeit eines KI-Assistenten: woraus sie sich zusammensetzt Die Antwortzeit eines KI-Assistenten besteht aus fünf Posten. Wer sie einzeln misst, findet schnellere Korrekturen als neue Hardware oder ein neues Modell. KI 8 min 14.09.2026 Warum KI-Features in der Praxis scheitern: sieben Stufen, an denen Fehler entstehen Warum KI-Features in der Praxis scheitern: sieben Stufen, an denen Fehler entstehen Eine falsche KI-Antwort hat fast immer eine Adresse. Wer die sieben Stufen eines KI-Features kennt, findet den Fehler, bevor jemand das Modell tauscht. Methodik 9 min 14.09.2026 Was ein RAG-System im Betrieb wirklich kostet Was ein RAG-System im Betrieb wirklich kostet Nicht das Modell ist der Kostenblock. Es sind Indexpflege, Evaluation und der Betrieb, und diese drei stehen in keinem Angebot, das nur die Entwicklung beziffert. Methodik 9 min 08.08.2026 Baidu OCR im Stack: warum klassische Texterkennung neben visueller Suche bleibt Baidu OCR im Stack: warum klassische Texterkennung neben visueller Suche bleibt OCR ist nicht tot. PaddleOCR-VL liefert durchsuchbaren Text dort, wo visuelle Suche allein nicht reicht. Werkzeuge 2 min 25.06.2026 F-RAG (RAG-Fusion): wie es sich von einfachem RAG unterscheidet F-RAG (RAG-Fusion): wie es sich von einfachem RAG unterscheidet RAG-Fusion führt mehrere Anfragevarianten aus und verschmilzt die Ergebnisse per Reciprocal Rank Fusion. Besserer Recall, etwas Abdrift-Risiko. Methodik 2 min 25.06.2026 Late Interaction erklärt: warum Qdrant und ColQwen die bessere Wissensdatenbank bauen Late Interaction erklärt: warum Qdrant und ColQwen die bessere Wissensdatenbank bauen Late Interaction vergleicht jeden Suchbegriff mit jedem Seitenausschnitt. Qdrant speichert das nativ. Methodik 2 min 25.06.2026 Der OCR-freie Dokumenten-Stack 2026: ColPali, ColQwen, ModernVBERT und Qdrant Der OCR-freie Dokumenten-Stack 2026: ColPali, ColQwen, ModernVBERT und Qdrant Visuelle Retrieval-Modelle durchsuchen die Seite als Bild statt per OCR. Ein nüchterner Überblick. Methodik 3 min 25.06.2026 Query-Zerlegung und der Advanced-RAG-Werkzeugkasten: passen Sie die Methode zum Versagen Query-Zerlegung und der Advanced-RAG-Werkzeugkasten: passen Sie die Methode zum Versagen Query-Zerlegung, HyDE, RAG-Fusion, GraphRAG beheben je ein Versagen. Das ausgefeilte RAG 2026 weiß, wann es keines nutzt. Methodik 4 min 25.06.2026 Schluss mit OCR? Visuelle Dokumentensuche und was sie für den Mittelstand ändert Schluss mit OCR? Visuelle Dokumentensuche und was sie für den Mittelstand ändert Visuelle Retrieval-Modelle finden Tabellen und Scans, an denen OCR-RAG scheitert. Was das praktisch heißt. KI 2 min 25.06.2026 Subquadratische LLMs: günstiger langer Kontext fürs On-Prem-RAG Subquadratische LLMs: günstiger langer Kontext fürs On-Prem-RAG Subquadratische Modelle senken die Kosten für langen Kontext. Ein echter Hebel fürs On-Prem-RAG, aber noch jung. Forschung 5 min 18.06.2026 Was ist RAG? Retrieval-Augmented Generation für den Mittelstand erklärt Was ist RAG? Retrieval-Augmented Generation für den Mittelstand erklärt RAG koppelt ein Sprachmodell an Ihre eigenen Dokumente, damit Antworten belegbar und aktuell bleiben. KI 4 min 16.06.2026 Retrieval-Augmented Generation, und warum sie souveräne KI trägt Retrieval-Augmented Generation, und warum sie souveräne KI trägt RAG verankert die Antworten eines Modells in abgerufenen Quellen und senkt Halluzination und Veraltung. Warum sie souveräne KI trägt. KI 5 min 01.04.2024

Dazu arbeiten wir

Wayne Dyer

“Wenn du die Art und Weise änderst, wie du die Dinge betrachtest, ändern sich die Dinge, die du betrachtest.”