¿Se acabó el OCR? La búsqueda visual de documentos y lo que cambia para la pyme
Los modelos de retrieval visual encuentran tablas y escaneos en los que el RAG con OCR fracasa. Qué significa eso en la práctica.
Traducción generada automáticamente con IA. La versión alemana es el original revisado por la redacción.
Cuando una búsqueda con IA sobre sus documentos se equivoca en los expedientes importantes, la culpa no suele ser del modelo de lenguaje, sino de la lectura previa. Justamente aquí aplica la búsqueda visual de documentos. En lugar de forzar primero una página escaneada a texto por OCR, busca la página directamente como imagen, con layout, tablas y sellos. Para la pyme, que rara vez tiene Markdown limpio pero sí muchos PDFs, escaneos y formularios, ese es el avance más relevante del año.
01. Dónde fracasa el RAG clásico en la pyme
RAG convierte sus documentos en conocimiento buscable. El punto débil es la primera etapa: el reconocimiento de texto. Una factura de proveedor con tabla de posiciones, un contrato de dos columnas, una hoja de datos escaneada con plano acotado: el OCR recompone algo así con regularidad de forma equivocada. La tabla se vuelve un desierto de cifras, las columnas se entrecruzan, el plano desaparece. El modelo recibe entonces ya texto roto y responde en consecuencia. En nuestra experiencia, con expedientes reales la mayor parte de los errores está aquí, mucho antes de que un modelo de lenguaje tome siquiera la palabra.
02. Cómo lo esquiva la búsqueda visual
Los modelos de retrieval visual se saltan el reconocimiento de texto al buscar. Descomponen la imagen de la página en muchos pequeños fragmentos, incrustan cada uno y comparan la consulta directamente con ellos. Así se conserva que una cifra está en una celda de tabla y no en el texto corrido. Tres nombres encabezan el campo: ColPali como referencia, ColQwen como variante casi siempre más fuerte sobre base Qwen, y ModernVBERT como modelo pequeño y apto para on-prem. Toda la caja de piezas junto con la base de datos vectorial la ordenamos en el resumen del stack. Para la mirada práctica basta: la página se ve, no se adivina.
03. Honesto sobre los costes
La ganancia no es gratis. Varios vectores por página necesitan bastante más memoria de índice que un único vector de texto. Con un archivo de texto corrido puro y limpio, el RAG de texto clásico sigue siendo más barato y basta. La búsqueda visual vale la pena allí donde el layout porta la información, y justamente eso es en la pyme más la regla que la excepción. Y para casos en los que al final necesita de todos modos texto buscable, por ejemplo para copiar o para un rastro de auditoría, el OCR sigue siendo sensato, como complemento en lugar de sustituto.
04. El primer paso es pequeño
No hay que reconstruir nada grande para ello. Tome los veinte documentos en los que su búsqueda actual fracasa, y haga justamente las preguntas que hoy se equivocan. Si la búsqueda visual encuentra la fila de tabla que el OCR perdió, tiene su respuesta, en sus propios expedientes, no en un benchmark. Lo bonito de ello: todo el montaje corre localmente, los datos se quedan en casa. Por qué eso cuenta para documentos sensibles está en On-Premise contra Cloud.

