Ce que cet outil ne fait pas
Il transforme une image en texte. Il ne conserve pas la mise en page d’origine, et une de ses fonctions communique avec un service externe.
Texte brut uniquement
Vous obtenez un fichier texte simple, pas un PDF avec une couche de recherche sur le scan, ni un document Word. Un outil de bureau comme OCRmyPDF réinsère le texte reconnu dans le fichier d’origine.
La mise en page ne survit pas
Les colonnes ont tendance à se mélanger et les tableaux perdent leurs cellules, ressortant sous forme d’une suite de chiffres. Une mise en page complexe demande un nettoyage manuel ensuite.
Traduire sort de l’appareil
Ouvrir le fichier, le dessiner et lancer l’OCR restent en local. Cliquer sur Traduire le texte envoie le texte extrait à l’API de MyMemory pour le traduire, après une confirmation. Évitez ce bouton pour du texte confidentiel.
Pas d’écriture manuscrite
Tesseract est entraîné sur du texte imprimé et lit l’écriture cursive comme du texte assuré mais faux.
La précision dépend du scan
Une résolution basse, un éclairage inégal et une photo tournée ou de travers réduisent tous la précision. Un scan plat, droit et bien éclairé donne le meilleur résultat.
L’anglais a un raccourci, pas les autres langues
La vérification de la couche de texte ne se fait que si la langue est l’anglais. Avec une autre langue d’OCR, l’outil dessine toujours la page et lance la reconnaissance, même sur un PDF où le texte est déjà sélectionnable.
Outils PDF associés
Questions fréquentes
Le fichier lui-même n’est pas envoyé. Le lire, dessiner ses pages et lancer l’OCR se passent dans cet onglet avec Tesseract.js et PDF.js. La seule exception est le bouton Traduire le texte, qui envoie le texte reconnu, pas le fichier, à un service de traduction externe si vous l’utilisez.
Seulement le texte présent à ce moment dans le champ de résultat, découpé en morceaux de moins de 500 caractères, vers l’API publique de traduction MyMemory sur internet. Il vous demande de confirmer la première fois que vous l’utilisez sur une page. Votre PDF ou votre image ne fait jamais partie de cette requête.
Si vous avez laissé la langue sur anglais et que le fichier est un PDF, l’outil cherche d’abord une couche de texte déjà présente dans le fichier, du genre que porte un export Word ou un PDF déjà passé par l’OCR. S’il y a assez de texte, il le renvoie directement et saute complètement l’OCR. Choisir une autre langue lance toujours la reconnaissance complète.
Non. Le résultat est uniquement du texte brut, affiché dans le champ et téléchargeable en .txt. Pour transformer ce texte en nouveau PDF, utilisez Texte en PDF ; pour garder le scan d’origine avec une couche de texte cachée en plus, un outil de bureau convient mieux.
La reconnaissance lit de gauche à droite par blocs, donc les pages à plusieurs colonnes et les tableaux ressortent souvent réordonnés ou réduits à une suite de chiffres. Une résolution basse, un éclairage inégal, une photo de travers, de petits caractères ou de l’écriture manuscrite réduisent aussi la précision.
Votre fichier reste sur votre appareil, presque toujours
Tesseract.js et PDF.js s’exécutent dans cet onglet pour lire le fichier et reconnaître son texte. Le fichier lui-même n’est pas envoyé. Si vous cliquez sur Traduire le texte, le texte reconnu, pas le fichier, est envoyé à l’API de traduction MyMemory après votre confirmation.