OCR für PDF und Bilder

pdf → txt

Erkennt den Text aus einem gescannten PDF oder einem Foto mit OCR, die in Ihrem Browser läuft, und lässt ihn kopieren oder als reinen Text herunterladen.

Einstellungen
WarteschlangeNichts wird hochgeladen
Gescanntes PDF oder Foto hierher ziehen
Text wird erkannt…

Über dieses OCR-Tool

Das Tool führt Tesseract.js aus, eine als WebAssembly kompilierte OCR-Engine, innerhalb eines Web Workers. Bei einem englischsprachigen PDF prüft es zuerst, ob die Datei bereits eine Textebene enthält, wie sie ein Word-Export oder ein PDF hat, das schon einmal durch eine OCR gelaufen ist, und gibt diesen Text sofort zurück, wenn genug davon vorhanden ist. Andernfalls wandelt es jede Seite in ein Bild um und erkennt den Text darauf.

Die Erkennung läuft pro Seite bis zu dreimal mit unterschiedlicher Bildverarbeitung: ein Kontrastdurchgang für blassen Text, ein invertierter Durchgang für hellen Text auf dunklem Hintergrund und zuletzt das unveränderte Bild. Der Durchgang mit dem meisten erkannten Text wird verwendet.

So wird es benutzt

01

Datei hinzufügen

Ziehen Sie ein gescanntes PDF oder das Foto einer Seite hinein, oder wählen Sie es über Datei auswählen aus.

02

Sprache wählen

Wählen Sie in der Liste der OCR-Sprachen die Sprache, in der der Text geschrieben ist. Standardmäßig ist Englisch eingestellt.

03

Text erkennen

Klicken Sie auf Text erkennen. Eine einzelne Seite ist in wenigen Sekunden fertig, ein mehrseitiger Scan dauert länger, Seite für Seite.

04

Kopieren oder herunterladen

Lesen Sie das Ergebnis im Textfeld und nutzen Sie Text kopieren oder .txt herunterladen. Text übersetzen schickt den Text nach außen, also bei vertraulichem Inhalt besser nicht anklicken.

Was es kann

  • Liest Text aus einem gescannten PDF, dem Foto einer Seite oder einer Bilddatei, eine Datei pro Durchgang.
  • Prüft ein englischsprachiges PDF zuerst auf eine vorhandene Textebene und gibt sie sofort zurück, ohne OCR zu starten, wenn genug Text vorhanden ist.
  • Wiederholt eine Seite mit einem invertierten oder unveränderten Bild, wenn der erste Durchgang fast nichts findet, was bei dunklen Hintergründen und blassen Scans hilft.
  • Erkennt elf Sprachen und drei Kombinationen mit Englisch, von Arabisch bis Chinesisch, wählbar in einer Liste vor der Umwandlung.
  • Markiert jede Seite mit einer Zeile „--- Page N ---“, wenn die Datei mehr als eine Seite hat.
  • Lässt das Ergebnis kopieren oder als .txt-Datei herunterladen. Die Schaltfläche Text übersetzen ist der einzige Teil dieser Seite, der etwas von Ihrem Gerät wegschickt.

Technische Daten

Merkmal Details
Akzeptiert Ein gescanntes PDF oder ein Bild (JPG, PNG und andere vom Browser darstellbare Formate) pro Durchgang, bis 100 MB
Ergebnis Reiner Text in einem Textfeld; .txt herunterladen speichert ihn als ocr_extracted_text.txt
OCR-Sprachen Englisch, Spanisch, Französisch, Deutsch, Hindi, Chinesisch, Japanisch, Portugiesisch, Italienisch, Arabisch, Russisch sowie drei Kombinationen mit Englisch
Erkennungs-Engine Tesseract.js 5.0.4, läuft als WebAssembly in einem Web Worker, geladen vom CDN cdnjs
PDF-Verarbeitung PDF.js 3.11 liest eine vorhandene Textebene oder zeichnet jede Seite mit rund 144 DPI für die OCR
Schaltfläche Text übersetzen Sendet den erkannten Text, nicht die Datei, über das Internet an die Übersetzungs-API von MyMemory, nach Ihrer Bestätigung
Wohin Ihre Datei geht Nirgendwohin. Sie wird in diesem Tab gelesen und erkannt.
Gut zu wissen

Was dieses Tool nicht kann

Es macht aus einem Bild Text. Das ursprüngliche Layout bleibt dabei nicht erhalten, und ein Teil des Tools spricht mit einem externen Dienst.

Nur reiner Text

Sie erhalten eine einfache Textdatei, kein durchsuchbares PDF mit dem Scan darunter und kein Word-Dokument. Ein Desktop-Tool wie OCRmyPDF fügt den erkannten Text stattdessen wieder in die Originaldatei ein.

Layout bleibt nicht erhalten

Spalten vermischen sich meist, und Tabellen verlieren ihre Zellen und werden zu einer Reihe von Zahlen. Ein komplexes Layout muss danach von Hand geordnet werden.

Übersetzen verlässt das Gerät

Datei öffnen, zeichnen und die OCR laufen lassen bleiben lokal. Ein Klick auf Text übersetzen sendet den erkannten Text zur Übersetzung an die API von MyMemory, nach einer Bestätigungsabfrage. Bei vertraulichem Text diese Schaltfläche meiden.

Keine Handschrift

Tesseract ist auf gedruckten Text trainiert und liest Schreibschrift als sicher wirkenden, aber falschen Text.

Genauigkeit hängt vom Scan ab

Niedrige Auflösung, ungleichmäßiges Licht und ein gedrehtes oder schiefes Foto verringern alle die Genauigkeit. Ein flacher, gerader, gut beleuchteter Scan liefert das beste Ergebnis.

Englisch hat eine Abkürzung, andere Sprachen nicht

Die Prüfung auf eine Textebene läuft nur, wenn die Sprache Englisch ist. Bei jeder anderen OCR-Sprache zeichnet das Tool die Seite immer und führt die Erkennung aus, selbst bei einem PDF mit bereits markierbarem Text.

Verwandte PDF-Tools

Häufige Fragen

Die Datei selbst wird nicht hochgeladen. Sie zu lesen, ihre Seiten zu zeichnen und die OCR auszuführen passiert alles in diesem Tab mit Tesseract.js und PDF.js. Die einzige Ausnahme ist die Schaltfläche Text übersetzen, die den erkannten Text, nicht die Datei, an einen externen Übersetzungsdienst sendet, wenn Sie sie benutzen.

Nur den Text, der gerade im Ergebnisfeld steht, aufgeteilt in Stücke unter 500 Zeichen, an die öffentliche Übersetzungs-API von MyMemory über das Internet. Sie werden beim ersten Gebrauch auf einer Seite um Bestätigung gebeten. Ihr PDF oder Bild ist nie Teil dieser Anfrage.

Wenn Sie die Sprache auf Englisch belassen haben und die Datei ein PDF ist, prüft das Tool zuerst, ob bereits eine Textebene in der Datei steckt, wie sie ein Word-Export oder ein PDF hat, das schon einmal durch eine OCR gelaufen ist. Ist genug Text vorhanden, gibt es ihn direkt zurück und überspringt die OCR vollständig. Eine andere Sprache führt immer die vollständige Erkennung aus.

Nein. Das Ergebnis ist ausschließlich reiner Text, angezeigt im Feld und als .txt herunterladbar. Um aus dem Text ein neues PDF zu machen, nutzen Sie Text zu PDF. Um den ursprünglichen Scan zu behalten und zusätzlich eine unsichtbare Textebene zu bekommen, eignet sich ein Desktop-Tool besser.

Die Erkennung liest blockweise von links nach rechts, daher kommen mehrspaltige Seiten und Tabellen oft in falscher Reihenfolge oder als Zahlenreihe zurück. Niedrige Auflösung, ungleichmäßiges Licht, ein schiefes Foto, kleine Schrift oder Handschrift verringern die Genauigkeit ebenfalls.

Ihre Datei bleibt meistens auf Ihrem Gerät

Tesseract.js und PDF.js laufen in diesem Tab, um die Datei zu lesen und ihren Text zu erkennen. Die Datei selbst wird nicht hochgeladen. Klicken Sie auf Text übersetzen, wird der erkannte Text, nicht die Datei, nach Ihrer Bestätigung an die Übersetzungs-API von MyMemory gesendet.