Dokumenten-OCR

Text aus gescannten PDFs per Browser-OCR extrahieren

Holen Sie die Wörter aus einem gescannten PDF oder dem Foto einer Seite heraus und erhalten Sie bearbeitbaren Text zurück, während die Erkennung direkt in Ihrem Browser läuft.

Das Erste, was versucht wird, ist keine OCR

Viele PDFs, die wie Scans aussehen, sind keine. Eine aus Word exportierte Datei oder ein Scan, der bereits eine andere Software durchlaufen hat, trägt unter dem Bild eine unsichtbare Textebene. Diese Ebene auszulesen liefert Ihnen genau die Zeichen, aus denen das Dokument ursprünglich besteht, ganz ohne Erkennungsfehler, und dauert etwa eine Sekunde.

Wenn Sie ihm also ein PDF geben, bei dem die Sprache auf Englisch steht, liest das Tool zuerst die Textebene. Findet es dort eine brauchbare Menge Text, gibt es diesen sofort zurück und startet die OCR-Engine gar nicht erst. Sie sehen dann, dass es fast augenblicklich fertig ist, und genau daran erkennen Sie es. Wählen Sie irgendeine andere Sprache, überspringt es diese Abkürzung und geht direkt zur Erkennung über. Haben Sie also ein englisches PDF, lassen Sie die Sprache unverändert und lassen Sie das Tool den schnellen Weg versuchen.

Wie ein echter Scan gelesen wird

Wenn kein Text zu finden ist, wird jede Seite als Bild mit 144 Pixel pro Zoll gerendert und an Tesseract übergeben, das als WebAssembly in Ihrem Browser läuft. Zuerst wird das Bild bereinigt. Das Tool misst die hellsten und dunkelsten Pixel der Seite, spreizt den Kontrast zwischen ihnen und zwingt jedes Pixel zu Schwarz oder Weiß, denn genau das will eine Erkennungs-Engine sehen.

Kommt dieser erste Durchlauf mit fast nichts zurück, laufen automatisch zwei weitere. Der zweite kehrt das Bild um, was hellen Text auf dunklem Hintergrund rettet, wie ihn etwa der Screenshot einer App im Dunkelmodus liefert. Der dritte gibt das unbearbeitete Bild direkt weiter, nach der Theorie, dass die Bereinigung selbst das Problem war. Es gewinnt der Durchlauf, der den meisten Text liefert. Sie wählen davon nichts aus, und genau deshalb kommt eine Seite, die hoffnungslos aussieht, manchmal erst beim dritten Versuch lesbar zurück.

Was Sie zurückbekommen

Das Ergebnis erscheint in einem Textfeld auf der Seite, mit einer Markierungslinie zwischen den Seiten, damit Sie erkennen, wo eine endet. Von dort aus können Sie es kopieren oder als .txt-Datei herunterladen. Das ist die gesamte Ausgabe. Das Tool liefert Ihnen kein durchsuchbares PDF mit einer unsichtbaren Textebene über dem Originalscan zurück, und es erzeugt auch keine Word-Datei. Brauchen Sie also ein PDF, in dem Sie suchen können, bekommen Sie hier die Wörter, aber nicht das Format.

Auch das Layout übersteht das nicht. Der Text kommt als Zeilenfluss zurück. Eine zweispaltige Seite kommt meist mit ineinander verschachtelten Spalten zurück, und eine Tabelle verliert ihre Zellen und wird zu einer Zahlenreihe. Rechnen Sie damit, Zeit hineinzustecken, um bei allem, was viel Struktur hatte, diese Struktur wiederherzustellen.

Was der Genauigkeit schadet

Die Erkennungsqualität hängt fast vollständig von dem Bild ab, das Sie ihr geben:

  • Quellscans mit niedriger Auflösung. Eine mit 150 DPI gescannte Seite hat dünne, unterbrochene Buchstabenstriche, und keine noch so aufwendige Verarbeitung erfindet die fehlenden Pixel zurück.
  • Ungleichmäßiges Licht. Die Kontrastspreizung misst die Seite als Ganzes statt Bereich für Bereich, sodass ein Foto mit einem Schatten auf einer Seite diese Seite komplett in reinem Schwarz verlieren kann.
  • Schräglage. Schon ein paar Grad Drehung, weil das Handy schräg gehalten wurde, kosten Sie Genauigkeit, und hier richtet nichts die Seite für Sie gerade. Drehen Sie sie gerade, bevor Sie anfangen.
  • Kleine Schrift, enger Zeilenabstand und dekorative oder Schreibschriftarten. Fußnoten und dicht gesetztes juristisches Kleingedrucktes sind durchweg der schlimmste Teil jeder Seite.
  • Handschrift. Tesseract ist auf gedruckte Zeichen trainiert und liefert aus Schreibschrift selbstbewussten Unsinn.

Wenn Sie den Scan selbst in der Hand haben, ist das Nützlichste, was Sie tun können, ihn flach, gerade und größer aufzunehmen. Alles, was danach kommt, wird dadurch leichter.

Die eine Schaltfläche, die Ihr Gerät verlässt

Die Erkennung läuft lokal ab. Ihr PDF wird im Tab gelesen, die Engine und ihre Sprachdaten werden bei der ersten Verwendung von einem öffentlichen CDN heruntergeladen, und keine Seite Ihres Dokuments wird irgendwohin gesendet. Eine Ausnahme gibt es auf dieser Seite, und die sollte man deutlich aussprechen: Die Schaltfläche „Übersetzen“ neben dem Ergebnis sendet den erkannten Text über das Internet an einen externen Übersetzungsdienst. Die Datei wird nie verschickt, die erkannten Wörter aber schon. Vermeiden Sie diese Schaltfläche, wenn das Dokument vertraulich ist.

Wann ein Desktop-Programm die bessere Antwort ist

Ein Tool wie OCRmyPDF schreibt den erkannten Text als unsichtbare Ebene in das ursprüngliche PDF zurück, sodass die Datei weiterhin wie der Scan aussieht, jetzt aber durchsuchbar ist, was ein Archiv in der Regel wirklich braucht. Desktop-Software entschrägt und entrauscht das Bild außerdem vor der Erkennung, rekonstruiert Tabellen und arbeitet unbeaufsichtigt einen Ordner mit Hunderten Dateien ab. Kommerzielle Engines liegen bei dichten, schlecht gescannten und mehrsprachigen Seiten weiterhin vorn. Nutzen Sie den Browser, wenn Sie die Wörter aus einem einzelnen Scan wollen, sofort, und lieber nicht hochladen möchten, nur um herauszufinden, was darin steht.

Ausprobieren

OCR für PDF und Bilder liest den Text aus Ihren Scans in diesem Tab. Die Datei selbst wird nie hochgeladen.

OCR für PDF und Bilder öffnen