Le stack documentaire sans OCR 2026 : ColPali, ColQwen, ModernVBERT et Qdrant
Les modèles de retrieval visuel parcourent la page comme une image plutôt que par OCR. Un aperçu lucide.
Traduction produite automatiquement par IA. La version allemande est l'original vérifié par la rédaction.
Pour le RAG documentaire, l'OCR n'est plus en 2026 la première étape allant de soi. Une série de modèles de retrieval visuel parcourt la page directement comme une image, donc avec sa mise en page, ses tableaux et ses diagrammes, sans la décomposer d'abord en texte. Cela change l'endroit d'une architecture RAG où naissent les erreurs et les briques dont on a encore besoin. Quatre noms reviennent sans cesse : ColPali, ColQwen, ModernVBERT et Qdrant. Ce texte les situe, sans battage, avec les endroits où le changement en vaut la peine, et ceux où il n'en vaut pas.
01. Pourquoi l'OCR était la partie bancale de la pipeline
L'OCR a longtemps été le point où des erreurs silencieuses entraient dans la réponse. La voie classique est une chaîne : scanner la page, la convertir en texte par OCR, la découper en morceaux, l'encoder, la récupérer. Chaque étape perd quelque chose. Une page à deux colonnes est mal réassemblée, un tableau se disloque en chiffres sans lien, un diagramme disparaît entièrement, car ce n'est pas du texte. D'après notre expérience, sur les documents difficiles, la plus grande part du problème de qualité ne se situe pas dans le modèle de langage, mais ici, dans la lecture. Le retrieval visuel agit précisément à cette étape : il saute la reconnaissance de texte lors de la recherche et travaille sur l'image de la page.
02. Les quatre briques, brièvement expliquées
ColPali. La référence, présentée en juillet 2024 (arXiv). Elle s'appuie sur le modèle vision-langage PaliGemma et produit environ 1024 vecteurs d'extraits d'image par page, chacun de dimension 128. Au lieu de comprimer la page en un seul vecteur, la granularité est préservée. La comparaison passe par la Late Interaction, une technique reprise de ColBERT, que nous détaillons ici.
ColQwen. La même recette, une autre base : ColQwen2.5 mise sur Qwen2.5-VL plutôt que PaliGemma et se place le plus souvent en tête sur le benchmark ViDoRe. Qui commence aujourd'hui a intérêt à démarrer ici.
ModernVBERT. Le levier d'efficacité. ColModernVBERT a 250 M de paramètres, soit environ dix fois moins que ColPali, et se situe pourtant selon le papier seulement 0,6 nDCG@5 en dessous. C'est la brique qui rend le retrieval visuel abordable en on-prem.
Qdrant. L'infrastructure sous-jacente. Qdrant stocke nativement les multi-vecteurs de ces modèles et calcule l'évaluation Late Interaction au moment de la recherche (doc). Sans une base vectorielle qui comprend plusieurs vecteurs par page, aucun des trois encodeurs ne fonctionne.
03. Quand le changement en vaut la peine, et quand non
Le retrieval visuel l'emporte là où la mise en page porte l'information. Contrats scannés, factures, fiches techniques, présentations, formulaires, dossiers multilingues : tout ce sur quoi une chaîne OCR échoue régulièrement. Il épargne en outre toute la maintenance de cette chaîne.
Ce n'est pourtant pas un gain systématique. Plusieurs vecteurs par page coûtent plus de mémoire et plus d'index qu'un seul vecteur de texte, souvent d'un facteur élevé. Pour du texte courant propre et pur, le RAG texte classique reste moins cher et tout à fait suffisant. Et certaines tâches ont finalement besoin de texte, par exemple une recherche en texte intégral, la copie ou une piste de vérification. Pour cela, il reste de bonnes raisons de recourir à l'OCR, en hybride aux côtés du retrieval visuel.
04. Une feuille de route lucide
- Tester avec ses propres documents, pas avec le benchmark. ViDoRe est un bon repère, mais votre fonds documentaire ne l'est pas. Prenez les vingt pages sur lesquelles votre recherche actuelle échoue.
- Démarrer avec ColQwen ou ColModernVBERT, selon le matériel. Sur un GPU restreint, le petit modèle est souvent le plus honnête.
- Mettre en place Qdrant comme magasin multi-vecteurs, Late Interaction au seul étage de re-ranking, pour garder l'index petit.
- Calculer le prix du stockage à l'avance. La taille de l'index est l'endroit qui fait mal ensuite, pas le choix du modèle.
Qui cherche l'arc plus large, donc pourquoi modèles locaux et retrieval propre vont ensemble : cela figure dans On-Premise contre cloud. Les briques individuelles, nous les approfondissons dans des textes dédiés, à commencer par le regard PME.

