Comment extraire un texte éditable d’un PDF scanné
Extrayez les mots d’un PDF scanné ou de la photo d’une page pour récupérer du texte brut modifiable, la reconnaissance s’exécutant dans votre propre navigateur.
La première chose qu’il essaie n’est pas l’OCR
De nombreux PDF qui ressemblent à des scans n’en sont pas. Un fichier exporté depuis Word, ou un scan déjà passé par un autre logiciel, contient une couche de texte invisible sous l’image. Lire cette couche vous donne les caractères exacts à partir desquels le document a été construit, sans aucune erreur de reconnaissance, et cela prend environ une seconde.
Donc quand vous lui donnez un PDF avec la langue laissée sur anglais, l’outil lit d’abord la couche de texte. S’il y trouve une quantité raisonnable de texte, il le renvoie immédiatement et ne démarre jamais le moteur OCR. Vous le verrez terminer presque instantanément, c’est le signe qui ne trompe pas. Choisissez n’importe quelle autre langue et il saute ce raccourci pour aller directement à la reconnaissance, donc si vous avez un PDF en anglais, laissez la langue telle quelle et laissez-le essayer la voie rapide.
Comment un vrai scan est lu
Quand il n’y a aucun texte à trouver, chaque page est rendue sous forme d’image à 144 pixels par pouce et transmise à Tesseract, qui s’exécute en WebAssembly dans votre navigateur. L’image est d’abord nettoyée. L’outil mesure les pixels les plus clairs et les plus sombres de la page, étire le contraste entre eux et force chaque pixel au noir ou au blanc, ce qu’un moteur de reconnaissance a besoin de voir.
Si cette première passe ne renvoie presque rien, deux autres s’exécutent automatiquement. La deuxième inverse l’image, ce qui sauve le texte blanc sur fond sombre, le genre de résultat que produit la capture d’écran d’une appli en mode sombre. La troisième transmet l’image telle quelle, sans retouche, sur l’idée que le nettoyage était le problème. C’est la passe qui produit le plus de texte qui l’emporte. Vous ne choisissez rien de tout cela, et c’est pourquoi une page qui semble perdue d’avance revient parfois lisible à la troisième tentative.
Ce que vous obtenez
Le résultat apparaît dans une zone de texte sur la page, avec une ligne de séparation entre les pages pour que vous sachiez où chacune se termine. De là, vous pouvez le copier ou le télécharger sous forme de fichier .txt. C’est toute la sortie proposée. L’outil ne vous renvoie pas de PDF interrogeable avec une couche de texte invisible par-dessus le scan d’origine, et il ne produit pas de fichier Word, donc si ce qu’il vous faut est un PDF dans lequel on peut faire une recherche, ceci vous donne les mots mais pas le format.
La mise en page ne survit pas non plus. Le texte arrive sous la forme d’un flux de lignes. Une page à deux colonnes en ressort généralement avec les colonnes entremêlées, et un tableau perd ses cellules pour devenir une suite de chiffres. Attendez-vous à passer du temps à redonner une structure à tout ce qui en avait beaucoup.
Ce qui nuit à la précision
La qualité de la reconnaissance dépend presque entièrement de l’image que vous lui donnez :
- Des scans sources en basse résolution. Une page scannée à 150 DPI a des traits de lettres fins et interrompus, et aucun traitement n’invente les pixels manquants pour les faire réapparaître.
- Un éclairage inégal. L’étirement du contraste mesure la page dans son ensemble plutôt que région par région, donc une photo avec une ombre sur un côté peut perdre ce côté entier dans du noir uni.
- L’inclinaison. Même quelques degrés de rotation dus à un téléphone tenu de travers vous coûtent en précision, et rien ici ne redresse la page pour vous. Alignez-la bien avant de commencer.
- Des caractères petits, un interlignage serré et des polices décoratives ou de type script. Les notes de bas de page et les petits caractères juridiques denses sont systématiquement la pire partie de n’importe quelle page.
- L’écriture manuscrite. Tesseract est entraîné sur des caractères imprimés et produira, avec assurance, du charabia à partir de l’écriture cursive.
Si vous contrôlez le scan, la chose la plus utile que vous puissiez faire est de le capturer à plat, bien droit et en plus grand. Tout ce qui suit en devient plus facile.
Le seul bouton qui quitte votre appareil
La reconnaissance est locale. Votre PDF est lu dans l’onglet, le moteur et ses données de langue sont téléchargés depuis un CDN public lors de la première utilisation, et aucune page de votre document n’est envoyée où que ce soit. Il y a une exception sur cette page et elle mérite d’être dite clairement : le bouton Traduire, à côté du résultat, envoie le texte extrait à un service de traduction externe par Internet. Le fichier ne part jamais, mais les mots reconnus, si. Évitez ce bouton si le document est confidentiel.
Quand un logiciel de bureau est la meilleure réponse
Un outil comme OCRmyPDF réécrit le texte reconnu dans le PDF d’origine sous forme de couche invisible, si bien que le fichier ressemble toujours au scan mais devient désormais interrogeable, ce dont une archive a généralement besoin. Les logiciels de bureau redressent aussi l’image et suppriment le bruit avant la reconnaissance, reconstruisent les tableaux, et traitent sans surveillance un dossier de centaines de fichiers. Les moteurs commerciaux gardent l’avantage sur les pages denses, de mauvaise qualité et multilingues. Utilisez le navigateur quand vous voulez récupérer les mots d’un scan, tout de suite, et que vous préférez ne pas l’envoyer en ligne pour savoir ce qu’il dit.
OCR de PDF et d’images lit le texte de vos scans dans cet onglet. Le fichier lui-même n’est jamais envoyé.
Ouvrir OCR de PDF et d’images