Was dieses Tool nicht kann
Es macht aus einem Bild Text. Das ursprüngliche Layout bleibt dabei nicht erhalten, und ein Teil des Tools spricht mit einem externen Dienst.
Nur reiner Text
Sie erhalten eine einfache Textdatei, kein durchsuchbares PDF mit dem Scan darunter und kein Word-Dokument. Ein Desktop-Tool wie OCRmyPDF fügt den erkannten Text stattdessen wieder in die Originaldatei ein.
Layout bleibt nicht erhalten
Spalten vermischen sich meist, und Tabellen verlieren ihre Zellen und werden zu einer Reihe von Zahlen. Ein komplexes Layout muss danach von Hand geordnet werden.
Übersetzen verlässt das Gerät
Datei öffnen, zeichnen und die OCR laufen lassen bleiben lokal. Ein Klick auf Text übersetzen sendet den erkannten Text zur Übersetzung an die API von MyMemory, nach einer Bestätigungsabfrage. Bei vertraulichem Text diese Schaltfläche meiden.
Keine Handschrift
Tesseract ist auf gedruckten Text trainiert und liest Schreibschrift als sicher wirkenden, aber falschen Text.
Genauigkeit hängt vom Scan ab
Niedrige Auflösung, ungleichmäßiges Licht und ein gedrehtes oder schiefes Foto verringern alle die Genauigkeit. Ein flacher, gerader, gut beleuchteter Scan liefert das beste Ergebnis.
Englisch hat eine Abkürzung, andere Sprachen nicht
Die Prüfung auf eine Textebene läuft nur, wenn die Sprache Englisch ist. Bei jeder anderen OCR-Sprache zeichnet das Tool die Seite immer und führt die Erkennung aus, selbst bei einem PDF mit bereits markierbarem Text.
Verwandte PDF-Tools
Häufige Fragen
Die Datei selbst wird nicht hochgeladen. Sie zu lesen, ihre Seiten zu zeichnen und die OCR auszuführen passiert alles in diesem Tab mit Tesseract.js und PDF.js. Die einzige Ausnahme ist die Schaltfläche Text übersetzen, die den erkannten Text, nicht die Datei, an einen externen Übersetzungsdienst sendet, wenn Sie sie benutzen.
Nur den Text, der gerade im Ergebnisfeld steht, aufgeteilt in Stücke unter 500 Zeichen, an die öffentliche Übersetzungs-API von MyMemory über das Internet. Sie werden beim ersten Gebrauch auf einer Seite um Bestätigung gebeten. Ihr PDF oder Bild ist nie Teil dieser Anfrage.
Wenn Sie die Sprache auf Englisch belassen haben und die Datei ein PDF ist, prüft das Tool zuerst, ob bereits eine Textebene in der Datei steckt, wie sie ein Word-Export oder ein PDF hat, das schon einmal durch eine OCR gelaufen ist. Ist genug Text vorhanden, gibt es ihn direkt zurück und überspringt die OCR vollständig. Eine andere Sprache führt immer die vollständige Erkennung aus.
Nein. Das Ergebnis ist ausschließlich reiner Text, angezeigt im Feld und als .txt herunterladbar. Um aus dem Text ein neues PDF zu machen, nutzen Sie Text zu PDF. Um den ursprünglichen Scan zu behalten und zusätzlich eine unsichtbare Textebene zu bekommen, eignet sich ein Desktop-Tool besser.
Die Erkennung liest blockweise von links nach rechts, daher kommen mehrspaltige Seiten und Tabellen oft in falscher Reihenfolge oder als Zahlenreihe zurück. Niedrige Auflösung, ungleichmäßiges Licht, ein schiefes Foto, kleine Schrift oder Handschrift verringern die Genauigkeit ebenfalls.
Ihre Datei bleibt meistens auf Ihrem Gerät
Tesseract.js und PDF.js laufen in diesem Tab, um die Datei zu lesen und ihren Text zu erkennen. Die Datei selbst wird nicht hochgeladen. Klicken Sie auf Text übersetzen, wird der erkannte Text, nicht die Datei, nach Ihrer Bestätigung an die Übersetzungs-API von MyMemory gesendet.