OCR de documentos

Cómo extraer texto editable de un PDF escaneado con OCR

Saca las palabras de un PDF escaneado o de la foto de una página y recupera texto plano que puedes editar, con el reconocimiento funcionando dentro de tu propio navegador.

Lo primero que intenta no es OCR

Muchos PDF que parecen escaneos no lo son. Un archivo exportado desde Word, o un escaneo que ya ha pasado por otro programa, lleva una capa de texto invisible debajo de la imagen. Leer esa capa te da los caracteres exactos con los que se construyó el documento, sin ningún error de reconocimiento, y tarda alrededor de un segundo.

Así que cuando le pasas un PDF con el idioma dejado en inglés, la herramienta lee primero la capa de texto. Si encuentra una cantidad razonable de texto ahí, lo devuelve de inmediato y nunca llega a arrancar el motor OCR. Verás que termina casi al instante, y esa es la señal. Elige cualquier otro idioma y se salta este atajo para ir directo al reconocimiento, así que si tienes un PDF en inglés, deja el idioma tal cual y déjala probar el camino rápido.

Cómo se lee un escaneo de verdad

Cuando no hay texto que encontrar, cada página se renderiza como una imagen a 144 píxeles por pulgada y pasa a Tesseract, que funciona como WebAssembly en tu navegador. Antes, la imagen se limpia. La herramienta mide los píxeles más claros y más oscuros de la página, amplía el contraste entre ellos y fuerza cada píxel a blanco o negro, que es lo que un motor de reconocimiento quiere ver.

Si esa primera pasada vuelve casi sin nada, se ejecutan otras dos automáticamente. La segunda invierte la imagen, lo que rescata el texto blanco sobre fondo oscuro, el tipo de cosa que produce la captura de pantalla de una app en modo oscuro. La tercera pasa la imagen tal cual, sin tocar, bajo la idea de que la limpieza era el problema. Gana la pasada que produzca más texto. Tú no eliges nada de esto, y por eso una página que parece perdida a veces vuelve legible al tercer intento.

Qué obtienes a cambio

El resultado aparece en un cuadro de texto en la página, con una línea marcadora entre páginas para que sepas dónde terminó cada una. Desde ahí puedes copiarlo o descargarlo como archivo .txt. Eso es toda la salida. La herramienta no te devuelve un PDF buscable con una capa de texto invisible sobre el escaneo original, ni produce un archivo de Word, así que si lo que necesitas es un PDF en el que se pueda buscar, esto te da las palabras pero no el formato.

El diseño tampoco sobrevive. El texto llega como un flujo de líneas. Una página a dos columnas suele salir con las columnas mezcladas entre sí, y una tabla pierde sus celdas y se convierte en una serie de números. Cuenta con dedicar tiempo a devolver la estructura a cualquier cosa que tuviera mucha.

Qué perjudica la precisión

La calidad del reconocimiento depende casi por completo de la imagen que le des:

  • Escaneos originales de baja resolución. Una página escaneada a 150 DPI tiene trazos de letra finos y rotos, y ningún procesamiento inventa de vuelta los píxeles que faltan.
  • Iluminación desigual. La ampliación de contraste mide la página como un todo, no región por región, así que una foto con una sombra en un lado puede perder ese lado entero en negro sólido.
  • Inclinación. Incluso un par de grados de rotación por sostener el móvil en ángulo te cuesta precisión, y aquí nada endereza la página por ti. Gírala hasta dejarla recta antes de empezar.
  • Letra pequeña, interlineado apretado y tipografías decorativas o de estilo manuscrito. Las notas al pie y la letra pequeña legal densa son siempre la peor parte de cualquier página.
  • Escritura a mano. Tesseract está entrenado con caracteres impresos y producirá disparates con mucha seguridad a partir de la letra cursiva.

Si tú controlas el escaneo, lo más útil que puedes hacer es capturarlo plano, recto y más grande. Todo lo que viene después se vuelve más fácil.

El único botón que sale de tu dispositivo

El reconocimiento es local. Tu PDF se lee en la pestaña, el motor y sus datos de idioma se descargan desde una CDN pública la primera vez que lo usas, y ninguna página de tu documento se envía a ningún sitio. Hay una excepción en esta página y merece decirse con claridad: el botón Traducir, junto al resultado, envía el texto extraído a un servicio de traducción externo por internet. El archivo nunca se envía, pero las palabras reconocidas sí. Evita ese botón si el documento es confidencial.

Cuándo un programa de escritorio es la mejor respuesta

Una herramienta como OCRmyPDF escribe el texto reconocido de vuelta en el PDF original como una capa invisible, así que el archivo sigue pareciendo el escaneo pero ahora se puede buscar en él, que es normalmente lo que necesita un archivo de verdad. El software de escritorio también endereza la imagen y limpia el ruido antes de reconocer, reconstruye tablas y funciona sobre una carpeta de cientos de archivos sin supervisión. Los motores comerciales siguen por delante en páginas densas, de mala calidad y multilingües. Usa el navegador cuando quieras sacar las palabras de un escaneo, ya, y prefieras no subirlo para averiguar qué dice.

Pruébalo

OCR de PDF e imágenes lee el texto de tus escaneos en esta pestaña. El archivo en sí nunca se sube.

Abrir OCR de PDF e imágenes