De OCR-vrije documentstack 2026: ColPali, ColQwen, ModernVBERT en Qdrant
Visuele retrievalmodellen doorzoeken de pagina als beeld in plaats van via OCR. Een nuchter overzicht.
Vertaling automatisch gegenereerd met AI. De Duitse versie is het redactioneel gecontroleerde origineel.
Voor document-RAG is OCR in 2026 niet meer de vanzelfsprekende eerste stap. Een reeks visuele retrievalmodellen doorzoekt de pagina direct als beeld, dus inclusief layout, tabellen en diagrammen, zonder ze eerst in tekst te ontleden. Dat verandert waar in een RAG-architectuur de fouten ontstaan en welke bouwstenen u eigenlijk nog nodig heeft. Vier namen duiken daarbij steeds weer op: ColPali, ColQwen, ModernVBERT en Qdrant. Deze tekst brengt ze in kaart, zonder hype, met de plekken waar de overstap loont, en die waar dat niet zo is.
01. Waarom OCR het wankele onderdeel van de pipeline was
OCR was lang het punt waarop stille fouten het antwoord binnenslopen. De klassieke weg is een keten: pagina scannen, via OCR omzetten naar tekst, in stukken knippen, embedden, ophalen. Elke stap verliest iets. Een pagina met twee kolommen wordt verkeerd samengevoegd, een tabel valt uiteen in losse cijfers, een diagram valt volledig weg omdat het geen tekst is. Naar onze ervaring zit bij lastige documenten het grootste deel van het kwaliteitsprobleem niet in het taalmodel, maar hier, in het lezen. Visueel retrieval grijpt precies op deze stap in: het slaat tekstherkenning bij het zoeken over en werkt op het beeld van de pagina.
02. De vier bouwstenen, kort uitgelegd
ColPali. De referentie, voorgesteld in juli 2024 (arXiv). Het bouwt voort op het vision-taalmodel PaliGemma en genereert ongeveer 1024 beelduitsnede-vectoren per pagina, elk 128-dimensionaal. In plaats van de pagina in een enkele vector te persen, blijft de granulariteit behouden. De matching gebeurt via Late Interaction, een techniek overgenomen van ColBERT, die we hier verder uitsplitsen.
ColQwen. Hetzelfde recept, andere basis: ColQwen2.5 zet in op Qwen2.5-VL in plaats van PaliGemma en staat op de ViDoRe-benchmark meestal vooraan. Wie vandaag opnieuw begint, begint hier zinvol.
ModernVBERT. De efficiëntiehefboom. ColModernVBERT heeft 250M parameters, dus ongeveer tien keer minder dan ColPali, en ligt volgens het paper toch maar 0,6 nDCG@5 daaronder. Dit is de bouwsteen die visueel retrieval on-premise betaalbaar maakt.
Qdrant. De infrastructuur eronder. Qdrant slaat de multi-vectoren van deze modellen native op en berekent de late-interaction-score bij het zoeken (documentatie). Zonder een vectordatabase die meerdere vectoren per pagina begrijpt, draait geen van de drie encoders.
03. Wanneer de overstap loont, en wanneer niet
Visueel retrieval wint daar waar de layout de informatie draagt. Gescande contracten, facturen, datasheets, presentaties, formulieren, meertalige dossiers: alles waarop een OCR-keten regelmatig faalt. Het bespaart bovendien het volledige onderhoud van die keten.
Het is echter geen automatische winst. Meerdere vectoren per pagina kosten meer opslag en meer index dan een enkele tekstvector, vaak een veelvoud. Bij schone, pure lopende tekst blijft klassiek tekst-RAG goedkoper en volledig toereikend. En sommige taken hebben uiteindelijk toch tekst nodig, zoals volledige tekstzoekopdrachten, kopiëren of een controlespoor. Daarvoor zijn er nog steeds goede redenen voor OCR, hybride naast visueel retrieval.
04. Een nuchtere routekaart
- Test met uw eigen documenten, niet met de benchmark. ViDoRe is een goed aanknopingspunt, maar uw dossiers zijn dat niet. Neem de twintig pagina's waarop uw huidige zoekfunctie faalt.
- Start met ColQwen of ColModernVBERT, afhankelijk van de hardware. Op een krappe GPU is het kleine model vaak het eerlijkere.
- Zet Qdrant op als multi-vectoropslag, late interaction alleen in de re-ranking-fase, om de index klein te houden.
- Reken de opslagprijs vooraf door. De indexgrootte is de plek die later pijn doet, niet de modelkeuze.
Wie de grotere boog zoekt, dus waarom lokale modellen en eigen retrieval eigenlijk bij elkaar horen: dat staat in On-premise versus cloud. De afzonderlijke bouwstenen verdiepen we in eigen teksten, beginnend bij de mkb-blik.

