AI · 2 MIN

Einde van OCR? Visueel documenten zoeken en wat het verandert voor het mkb

Visuele retrievalmodellen vinden tabellen en scans waar OCR-RAG op vastloopt. Wat dat praktisch betekent.

Einde van OCR? Visueel documenten zoeken en wat het verandert voor het mkb
LOCATIE
Rijnland-Palts
AUTEUR
Aashwin Shrivastava
GEPUBLICEERD
25 jun 2026
BEELD
AI-GEGENEREERD

Vertaling automatisch gegenereerd met AI. De Duitse versie is het redactioneel gecontroleerde origineel.

Als een AI-zoekopdracht over uw documenten net bij de belangrijke dossiers misgrijpt, ligt dat meestal niet aan het taalmodel, maar aan het lezen ervoor. Precies daar grijpt visueel documenten zoeken in. In plaats van een gescande pagina eerst met OCR in tekst te forceren, doorzoekt het de pagina direct als afbeelding, met layout, tabellen en stempels. Voor het mkb, dat zelden schone markdown heeft maar wel veel PDF's, scans en formulieren, is dat de relevantere doorbraak van het jaar.

01. Waar klassieke RAG in het mkb vastloopt

RAG maakt van uw documenten doorzoekbare kennis. Het zwakke punt is de eerste fase: de tekstherkenning. Een leveranciersfactuur met positietabel, een tweekoloms contract, een ingescand datasheet met maattekening: OCR zet dat soort dingen geregeld verkeerd in elkaar. De tabel wordt een cijferbrij, de kolommen lopen door elkaar, de tekening verdwijnt. Het model krijgt dan al kapotte tekst en antwoordt dienovereenkomstig. In onze ervaring zit bij echte dossiers het grootste deel van de fouten hier, lang voordat een taalmodel überhaupt aan het woord komt.

02. Hoe visueel zoeken dit omzeilt

Visuele retrievalmodellen slaan de tekstherkenning bij het zoeken over. Ze splitsen de afbeelding van de pagina op in veel kleine fragmenten, embedden elk fragment en vergelijken de zoekvraag daar direct mee. Zo blijft behouden dat een getal in een tabelcel staat en niet in de lopende tekst. Drie namen leiden het veld: ColPali als referentie, ColQwen als meestal sterkere variant op Qwen-basis, en ModernVBERT als klein, on-premise-geschikt model. De hele toolkit inclusief vectordatabase brengen we onder in het stackoverzicht. Voor het praktische beeld volstaat: de pagina wordt gezien, niet geraden.

03. Eerlijk over de kosten

De winst is niet gratis. Meerdere vectoren per pagina vereisen aanzienlijk meer indexopslag dan een enkele tekstvector. Bij een archief van pure, schone lopende tekst blijft klassieke tekst-RAG goedkoper en volstaat het. Visueel zoeken loont waar de layout de informatie draagt, en dat is in het mkb eerder de regel dan de uitzondering. En voor gevallen waarin u uiteindelijk toch doorzoekbare tekst nodig heeft, bijvoorbeeld om te kopiëren of voor een audittrail, blijft OCR zinvol, als aanvulling in plaats van vervanging.

04. De eerste stap is klein

Daarvoor hoeft u niets groots te verbouwen. Neem de twintig documenten waar uw huidige zoekfunctie op vastloopt, en stel precies de vragen die vandaag misgaan. Als visueel zoeken de tabelrij vindt die OCR kwijtraakte, heeft u uw antwoord, op uw eigen dossiers, niet op een benchmark. Het mooie eraan: de hele opzet draait lokaal, de data blijft in huis. Waarom dat telt voor gevoelige documenten, staat in On-premise versus cloud.

← Signals

Wayne Dyer

“Als u de manier waarop u naar dingen kijkt verandert, veranderen de dingen waar u naar kijkt.”