OCR de PDF e imágenes

pdf → txt

Extrae el texto de un PDF escaneado o de una foto con OCR que se ejecuta en tu navegador, y luego cópialo o descárgalo como texto sin formato.

Ajustes
ColaNo se sube nada
Suelta aquí un PDF escaneado o una foto
Reconociendo el texto…

Acerca de esta herramienta de OCR

La herramienta ejecuta Tesseract.js, un motor de OCR compilado a WebAssembly, dentro de un Web Worker. Con un PDF en inglés, primero comprueba si el archivo ya tiene una capa de texto, del tipo que llevan un documento exportado desde Word o un PDF que ya ha pasado por OCR, y devuelve ese texto de inmediato si hay suficiente. Si no, convierte cada página en una imagen y reconoce el texto que contiene.

El reconocimiento se ejecuta hasta tres veces por página con distintos procesados de imagen: una pasada de contraste para texto tenue, una pasada invertida para texto claro sobre fondo oscuro, y la imagen sin modificar como último recurso. Se queda con la pasada que devuelve más texto.

Cómo usarlo

01

Añade un archivo

Suelta un PDF escaneado o la foto de una página, o elígelo con Seleccionar archivo.

02

Elige el idioma

Elige en la lista de idiomas de OCR el idioma en el que está escrito el texto. Por defecto es inglés.

03

Extrae el texto

Pulsa Extraer texto. Una sola página se procesa en unos segundos; un escaneo de varias páginas tarda más, una página tras otra.

04

Copia o descarga

Lee el resultado en el cuadro de texto y usa Copiar texto o Descargar .txt. Traducir texto envía el texto fuera de tu dispositivo, así que evítalo con algo privado.

Qué hace

  • Lee el texto de un PDF escaneado, una foto de una página o un archivo de imagen, un archivo cada vez.
  • Con un PDF en inglés, comprueba primero si ya tiene una capa de texto y la devuelve al instante, sin ejecutar OCR, cuando hay suficiente.
  • Si la primera pasada no encuentra casi nada, repite la página con una imagen invertida o sin modificar, lo que ayuda con fondos oscuros y escaneos tenues.
  • Reconoce once idiomas y tres combinaciones con inglés, del árabe al chino, elegidos en una lista antes de convertir.
  • Marca cada página con una línea «--- Page N ---» cuando el archivo tiene más de una página.
  • Te deja copiar el resultado o descargarlo como archivo .txt. El botón Traducir texto es la única parte de esta página que envía algo fuera de tu dispositivo.

Especificaciones

Especificación Detalles
Admite Un PDF escaneado o una imagen (JPG, PNG y otros formatos que tu navegador pueda mostrar) cada vez, hasta 100 MB
Resultado Texto sin formato en un cuadro de texto; Descargar .txt lo guarda como ocr_extracted_text.txt
Idiomas de OCR Inglés, español, francés, alemán, hindi, chino, japonés, portugués, italiano, árabe, ruso, y tres combinaciones con inglés
Motor de reconocimiento Tesseract.js 5.0.4, que se ejecuta como WebAssembly en un Web Worker, cargado desde la CDN cdnjs
Gestión del PDF PDF.js 3.11 lee una capa de texto existente o dibuja cada página a unos 144 DPI para el OCR
Botón Traducir texto Envía el texto extraído, no el archivo, a la API de traducción de MyMemory por internet, después de que lo confirmes
Adónde va tu archivo A ninguna parte. Se lee y se reconoce dentro de esta pestaña.
Conviene saber

Lo que no hace esta herramienta

Convierte una imagen en texto. No conserva el diseño original, y una parte de ella habla con un servicio externo.

Solo texto sin formato

Obtienes un archivo de texto plano, no un PDF con capa de búsqueda sobre el escaneo ni un documento de Word. Una herramienta de escritorio como OCRmyPDF añade el texto reconocido de vuelta al archivo original.

El diseño no se conserva

Las columnas tienden a mezclarse y las tablas pierden sus celdas, quedando como una serie de números. Un diseño complejo necesita ordenarse a mano después.

Traducir sale de tu dispositivo

Abrir el archivo, dibujarlo y ejecutar el OCR se quedan en tu equipo. Pulsar Traducir texto envía el texto extraído a la API de MyMemory para traducirlo, tras un aviso de confirmación. Evita ese botón con texto confidencial.

Sin escritura a mano

Tesseract está entrenado con texto impreso y lee la letra cursiva como texto seguro pero equivocado.

La precisión depende del escaneo

Una resolución baja, una luz despareja y una foto girada o torcida reducen la precisión. Un escaneo plano, recto y bien iluminado da el mejor resultado.

El inglés tiene un atajo; los demás idiomas no

La comprobación de la capa de texto solo se hace cuando el idioma es inglés. Con cualquier otro idioma de OCR, siempre dibuja la página y ejecuta el reconocimiento, incluso en un PDF que ya tiene texto seleccionable.

Herramientas de PDF relacionadas

Preguntas frecuentes

El archivo en sí no se sube. Leerlo, dibujar sus páginas y ejecutar el OCR ocurre dentro de esta pestaña con Tesseract.js y PDF.js. La única excepción es el botón Traducir texto, que envía el texto reconocido, no el archivo, a un servicio de traducción externo si lo usas.

Solo el texto que hay en ese momento en el cuadro de resultado, dividido en fragmentos de menos de 500 caracteres, a la API pública de traducción de MyMemory por internet. Te pide confirmarlo la primera vez que lo usas en una página. Tu PDF o imagen nunca forma parte de esa petición.

Si dejaste el idioma en inglés y el archivo es un PDF, la herramienta primero busca una capa de texto ya presente en el archivo, del tipo que lleva un documento exportado desde Word o un PDF que ya ha pasado por OCR. Si hay suficiente texto ahí, lo devuelve directamente y se salta el OCR por completo. Elegir otro idioma siempre ejecuta el reconocimiento completo.

No. El resultado es solo texto sin formato, que se muestra en el cuadro y se puede descargar como .txt. Para convertir el texto en un PDF nuevo, usa Texto a PDF; para conservar el escaneo original y añadirle una capa de texto oculta, una herramienta de escritorio es mejor opción.

El reconocimiento lee de izquierda a derecha por bloques, así que las páginas a varias columnas y las tablas suelen salir reordenadas o reducidas a una serie de números. Una resolución baja, una luz despareja, una foto torcida, letra pequeña o escritura a mano también reducen la precisión.

Tu archivo se queda en tu dispositivo, casi siempre

Tesseract.js y PDF.js se ejecutan en esta pestaña para leer el archivo y reconocer su texto. El archivo en sí no se sube. Si pulsas Traducir texto, el texto reconocido, no el archivo, se envía a la API de traducción de MyMemory después de que lo confirmes.