IA2 MIN

Tu PDF se abre, pero la IA no lo lee bien: cómo distinguir un escaneo de un documento

Un archivo puede contener texto, fotografías de páginas o ambas cosas. El OCR y la lectura visual resuelven problemas distintos, y ninguno elimina la revisión.

Escáner cenital de documentos sceyeX
Imagen: JamesMoorey · CC BY-SA 3.0

Que puedas abrir un PDF no significa que la aplicación de IA reciba su contenido de una forma útil. Un escaneo puede ser una colección de fotografías, sin texto que copiar. Algunos sistemas analizan esas imágenes directamente, mientras que otros trabajan con el texto extraído. Antes de convertir nada, hay una comprobación sencilla.

Abre el documento e intenta seleccionar una frase. Cópiala en un editor y comprueba si conserva palabras y orden. Si no puedes seleccionarla, probablemente esa página no tiene una capa de texto utilizable. Si puedes, eso tampoco garantiza que una tabla se haya extraído correctamente.

01

OCR convierte la imagen en caracteres

El reconocimiento óptico de caracteres, u OCR, identifica letras y números en una imagen y los convierte en texto. El modelo Read de Microsoft es un ejemplo de ese proceso. Sirve para hacer buscable un documento escaneado y facilitar que otras herramientas lean sus palabras.

El resultado puede confundir un cero con una letra, mezclar columnas o perder un signo negativo. No borres el escaneo original. Conserva una copia con OCR y compara un párrafo, una tabla y una cifra importante antes de trabajar con todo el archivo. Las fotos de escáneres de este artículo son ilustrativas, no una recomendación de compra.

Escáner de sobremesa abierto
Imagen: Users Boffy b, Arpingstone on en.wikipedia · Public domain
02

Una IA con visión puede leer el PDF sin ese paso

Google documenta que Gemini procesa PDFs con visión, incluidas imágenes, gráficos y tablas. Claude también ofrece procesamiento visual de PDF. Por eso no existe una regla universal que obligue a pasar todo escaneo por OCR. La aplicación debe enviar las páginas al modelo de una forma compatible.

Tener un modelo con visión no garantiza que cualquier conector o buscador interno conserve las imágenes. Si una herramienta extrae solo texto para responder, un gráfico o una página escaneada pueden quedar fuera. En nuestra explicación de RAG detallamos cómo una aplicación recupera fragmentos para una respuesta.

Digitalización de documentos en Leavenworth
Imagen: Julia Pinnix/USFWS · Public domain
03

Haz una prueba pequeña antes de pedir el resumen completo

Pide que transcriba una frase visible en una página concreta y que identifique los encabezados de una tabla. Comprueba ambos resultados en el PDF. Después solicita la respuesta que necesitas con páginas de referencia, teniendo en cuenta que el número impreso y el contador del visor pueden ser distintos.

Si falla, prueba una página recortada y legible o una copia con OCR, sin eliminar el original. No subas documentos privados a otro servicio solo porque el primero no los entiende. Revisa permisos, como explicamos en la guía de acceso de agentes a tus archivos.

00

La conversación empieza aquí

Accede con una cuenta de apoyo para comentar. Entrar

Todavía no ha comentado nadie. ¿Estrenas tú?

TU SIGUIENTE RUTA

Sigue tirando del hilo de IA, trabajo y educación

Si este tema te interesa, estas tres piezas son el mejor lugar por el que seguir.

ABRIR EL TEMA COMPLETO
  1. 01Qué permisos darle a un agente de IA y cómo quitárselos cuando acabesIA · 3 MIN
  2. 02Google regala un año de Gemini a los estudiantes, pero en España no incluye el plan ProIA · 5 MIN
  3. 03Elon Musk: 'El dinero no importará en 2036'. La IA nos habrá superado cinco años antesIA · 4 MIN

SIGUE LEYENDO

También te puede interesar

PORTADA