Baidu OCR en el stack: por qué el reconocimiento de texto clásico permanece junto a la búsqueda visual
El OCR no ha muerto. PaddleOCR-VL entrega texto buscable allí donde la búsqueda visual por sí sola no basta.
Traducción generada automáticamente con IA. La versión alemana es el original revisado por la redacción.
Con todo el entusiasmo por la búsqueda visual de documentos, vale la pena una frase sobria: el OCR no ha muerto. El reconocimiento de texto moderno como PaddleOCR-VL de Baidu se ha vuelto tan bueno y tan económico que conserva un lugar fijo junto al retrieval visual, no como competencia, sino como la etapa que entrega texto buscable, copiable y verificable. La pregunta correcta no es OCR o búsqueda visual, sino para qué cada uno.
01. LO QUE LA BÚSQUEDA VISUAL DELIBERADAMENTE NO ENTREGA
Los modelos de retrieval visual encuentran la página correcta, incluso en un escaneo difícil. Pero le devuelven una imagen, no texto. No puede copiar sin más una línea de ahí, ni tender una búsqueda de texto completo sobre el archivo, ni construir un rastro de auditoría legible por máquina. Para todo eso necesita texto reconocido. Esto no es una debilidad del nuevo enfoque, sino una división del trabajo deliberada: búsqueda sobre la imagen, obtención de texto por OCR, cada etapa para lo que mejor sabe hacer.
02. LO QUE PADDLEOCR-VL SABE HACER
Baidu ha presentado con PaddleOCR-VL un modelo OCR abierto que alcanza valores de primer nivel con apenas 0,9 mil millones de parámetros (proyecto). Reconoce texto, tablas, fórmulas y diagramas en 109 idiomas y reconstruye la estructura semántica de un documento. En el benchmark OmniDocBench v1.5 encabeza con alrededor de un 94,5% de precisión. Está bajo la licencia Apache-2.0, por lo que es de uso comercial libre y operable localmente. Para una pyme eso significa: reconocimiento de texto potente sin tarifa recurrente y sin fuga de datos.
03. EL MONTAJE HÍBRIDO
En la práctica, ambas vías corren en paralelo. La búsqueda visual encuentra las páginas relevantes de forma rápida y fiel al layout. Donde de ahí debe salir texto duro, por ejemplo para una posición de factura, una cláusula contractual que citar o una entrada en el ERP, el OCR se hace cargo justamente de esas pocas páginas. No hay que pasar todo el archivo por OCR, solo lo que la búsqueda ya ha marcado como importante. Eso mantiene el pipeline esbelto y evita que los errores de OCR se filtren en la búsqueda desde el principio.
04. LA LÍNEA PRAGMÁTICA
El o esto o lo otro es aquí la postura equivocada. La búsqueda visual mejora el encontrar, el OCR mejora el procesar después. Quien entiende ambos como herramientas con tareas claras construye la base de conocimiento más sólida que quien apuesta dogmáticamente por un solo bando. Cómo encajan las piezas, desde el encoder hasta la base de datos vectorial, está en el resumen del stack.

