OCR de PDF et d’images

pdf → txt

Extrayez le texte d’un PDF scanné ou d’une photo avec un OCR qui s’exécute dans votre navigateur, puis copiez-le ou téléchargez-le en texte brut.

Réglages
File d’attenteRien n’est envoyé
Déposez ici un PDF scanné ou une photo
Reconnaissance du texte…

À propos de cet outil d’OCR

L’outil exécute Tesseract.js, un moteur d’OCR compilé en WebAssembly, à l’intérieur d’un Web Worker. Pour un PDF en anglais, il vérifie d’abord si le fichier a déjà une couche de texte, du genre que porte un export Word ou un PDF déjà passé par l’OCR, et renvoie ce texte immédiatement s’il y en a assez. Sinon, il convertit chaque page en image et reconnaît le texte qu’elle contient.

La reconnaissance s’exécute jusqu’à trois fois par page avec des traitements d’image différents : une passe de contraste pour le texte pâle, une passe inversée pour du texte clair sur fond sombre, et l’image telle quelle en dernier recours. La passe qui renvoie le plus de texte est retenue.

Mode d’emploi

01

Ajoutez un fichier

Déposez un PDF scanné ou la photo d’une page, ou choisissez-le avec Sélectionner un fichier.

02

Choisissez la langue

Choisissez dans la liste des langues d’OCR la langue dans laquelle le texte est écrit. Elle est réglée sur l’anglais par défaut.

03

Extrayez le texte

Cliquez sur Extraire le texte. Une seule page se traite en quelques secondes ; un scan de plusieurs pages prend plus de temps, une page après l’autre.

04

Copiez ou téléchargez

Lisez le résultat dans le champ de texte, puis utilisez Copier le texte ou Télécharger le .txt. Traduire le texte l’envoie hors de votre appareil, évitez-le donc pour tout contenu confidentiel.

Ce qu’il fait

  • Lit le texte d’un PDF scanné, d’une photo de page ou d’un fichier image, un fichier à la fois.
  • Pour un PDF en anglais, vérifie d’abord s’il a déjà une couche de texte et la renvoie aussitôt, sans lancer l’OCR, s’il y en a assez.
  • Si la première passe ne trouve presque rien, reprend la page avec une image inversée ou telle quelle, ce qui aide avec les fonds sombres et les scans pâles.
  • Reconnaît onze langues et trois combinaisons avec l’anglais, de l’arabe au chinois, choisies dans une liste avant la conversion.
  • Marque chaque page d’une ligne « --- Page N --- » quand le fichier compte plusieurs pages.
  • Permet de copier le résultat ou de le télécharger en fichier .txt. Le bouton Traduire le texte est la seule partie de cette page qui envoie quoi que ce soit hors de votre appareil.

Caractéristiques techniques

Caractéristique Détails
Accepte Un PDF scanné ou une image (JPG, PNG et autres formats affichables par votre navigateur) à la fois, jusqu’à 100 Mo
Résultat Texte brut dans un champ de texte ; Télécharger le .txt l’enregistre sous ocr_extracted_text.txt
Langues d’OCR Anglais, espagnol, français, allemand, hindi, chinois, japonais, portugais, italien, arabe, russe, et trois combinaisons avec l’anglais
Moteur de reconnaissance Tesseract.js 5.0.4, exécuté en WebAssembly dans un Web Worker, chargé depuis le CDN cdnjs
Traitement du PDF PDF.js 3.11 lit une couche de texte existante ou dessine chaque page à environ 144 DPI pour l’OCR
Bouton Traduire le texte Envoie le texte extrait, pas le fichier, à l’API de traduction MyMemory sur internet, après votre confirmation
Où va votre fichier Nulle part. Il est lu et reconnu dans cet onglet.
Bon à savoir

Ce que cet outil ne fait pas

Il transforme une image en texte. Il ne conserve pas la mise en page d’origine, et une de ses fonctions communique avec un service externe.

Texte brut uniquement

Vous obtenez un fichier texte simple, pas un PDF avec une couche de recherche sur le scan, ni un document Word. Un outil de bureau comme OCRmyPDF réinsère le texte reconnu dans le fichier d’origine.

La mise en page ne survit pas

Les colonnes ont tendance à se mélanger et les tableaux perdent leurs cellules, ressortant sous forme d’une suite de chiffres. Une mise en page complexe demande un nettoyage manuel ensuite.

Traduire sort de l’appareil

Ouvrir le fichier, le dessiner et lancer l’OCR restent en local. Cliquer sur Traduire le texte envoie le texte extrait à l’API de MyMemory pour le traduire, après une confirmation. Évitez ce bouton pour du texte confidentiel.

Pas d’écriture manuscrite

Tesseract est entraîné sur du texte imprimé et lit l’écriture cursive comme du texte assuré mais faux.

La précision dépend du scan

Une résolution basse, un éclairage inégal et une photo tournée ou de travers réduisent tous la précision. Un scan plat, droit et bien éclairé donne le meilleur résultat.

L’anglais a un raccourci, pas les autres langues

La vérification de la couche de texte ne se fait que si la langue est l’anglais. Avec une autre langue d’OCR, l’outil dessine toujours la page et lance la reconnaissance, même sur un PDF où le texte est déjà sélectionnable.

Outils PDF associés

Questions fréquentes

Le fichier lui-même n’est pas envoyé. Le lire, dessiner ses pages et lancer l’OCR se passent dans cet onglet avec Tesseract.js et PDF.js. La seule exception est le bouton Traduire le texte, qui envoie le texte reconnu, pas le fichier, à un service de traduction externe si vous l’utilisez.

Seulement le texte présent à ce moment dans le champ de résultat, découpé en morceaux de moins de 500 caractères, vers l’API publique de traduction MyMemory sur internet. Il vous demande de confirmer la première fois que vous l’utilisez sur une page. Votre PDF ou votre image ne fait jamais partie de cette requête.

Si vous avez laissé la langue sur anglais et que le fichier est un PDF, l’outil cherche d’abord une couche de texte déjà présente dans le fichier, du genre que porte un export Word ou un PDF déjà passé par l’OCR. S’il y a assez de texte, il le renvoie directement et saute complètement l’OCR. Choisir une autre langue lance toujours la reconnaissance complète.

Non. Le résultat est uniquement du texte brut, affiché dans le champ et téléchargeable en .txt. Pour transformer ce texte en nouveau PDF, utilisez Texte en PDF ; pour garder le scan d’origine avec une couche de texte cachée en plus, un outil de bureau convient mieux.

La reconnaissance lit de gauche à droite par blocs, donc les pages à plusieurs colonnes et les tableaux ressortent souvent réordonnés ou réduits à une suite de chiffres. Une résolution basse, un éclairage inégal, une photo de travers, de petits caractères ou de l’écriture manuscrite réduisent aussi la précision.

Votre fichier reste sur votre appareil, presque toujours

Tesseract.js et PDF.js s’exécutent dans cet onglet pour lire le fichier et reconnaître son texte. Le fichier lui-même n’est pas envoyé. Si vous cliquez sur Traduire le texte, le texte reconnu, pas le fichier, est envoyé à l’API de traduction MyMemory après votre confirmation.