Lo que no hace esta herramienta
Convierte una imagen en texto. No conserva el diseño original, y una parte de ella habla con un servicio externo.
Solo texto sin formato
Obtienes un archivo de texto plano, no un PDF con capa de búsqueda sobre el escaneo ni un documento de Word. Una herramienta de escritorio como OCRmyPDF añade el texto reconocido de vuelta al archivo original.
El diseño no se conserva
Las columnas tienden a mezclarse y las tablas pierden sus celdas, quedando como una serie de números. Un diseño complejo necesita ordenarse a mano después.
Traducir sale de tu dispositivo
Abrir el archivo, dibujarlo y ejecutar el OCR se quedan en tu equipo. Pulsar Traducir texto envía el texto extraído a la API de MyMemory para traducirlo, tras un aviso de confirmación. Evita ese botón con texto confidencial.
Sin escritura a mano
Tesseract está entrenado con texto impreso y lee la letra cursiva como texto seguro pero equivocado.
La precisión depende del escaneo
Una resolución baja, una luz despareja y una foto girada o torcida reducen la precisión. Un escaneo plano, recto y bien iluminado da el mejor resultado.
El inglés tiene un atajo; los demás idiomas no
La comprobación de la capa de texto solo se hace cuando el idioma es inglés. Con cualquier otro idioma de OCR, siempre dibuja la página y ejecuta el reconocimiento, incluso en un PDF que ya tiene texto seleccionable.
Herramientas de PDF relacionadas
Preguntas frecuentes
El archivo en sí no se sube. Leerlo, dibujar sus páginas y ejecutar el OCR ocurre dentro de esta pestaña con Tesseract.js y PDF.js. La única excepción es el botón Traducir texto, que envía el texto reconocido, no el archivo, a un servicio de traducción externo si lo usas.
Solo el texto que hay en ese momento en el cuadro de resultado, dividido en fragmentos de menos de 500 caracteres, a la API pública de traducción de MyMemory por internet. Te pide confirmarlo la primera vez que lo usas en una página. Tu PDF o imagen nunca forma parte de esa petición.
Si dejaste el idioma en inglés y el archivo es un PDF, la herramienta primero busca una capa de texto ya presente en el archivo, del tipo que lleva un documento exportado desde Word o un PDF que ya ha pasado por OCR. Si hay suficiente texto ahí, lo devuelve directamente y se salta el OCR por completo. Elegir otro idioma siempre ejecuta el reconocimiento completo.
No. El resultado es solo texto sin formato, que se muestra en el cuadro y se puede descargar como .txt. Para convertir el texto en un PDF nuevo, usa Texto a PDF; para conservar el escaneo original y añadirle una capa de texto oculta, una herramienta de escritorio es mejor opción.
El reconocimiento lee de izquierda a derecha por bloques, así que las páginas a varias columnas y las tablas suelen salir reordenadas o reducidas a una serie de números. Una resolución baja, una luz despareja, una foto torcida, letra pequeña o escritura a mano también reducen la precisión.
Tu archivo se queda en tu dispositivo, casi siempre
Tesseract.js y PDF.js se ejecutan en esta pestaña para leer el archivo y reconocer su texto. El archivo en sí no se sube. Si pulsas Traducir texto, el texto reconocido, no el archivo, se envía a la API de traducción de MyMemory después de que lo confirmes.