Un PDF scanné est une image de page : ses mots ne peuvent être ni sélectionnés, ni recherchés, ni copiés tant qu'un logiciel d'OCR (reconnaissance optique de caractères) ne les a pas lus. Pour extraire le texte d'un PDF scanné, importez le fichier dans un outil de reconnaissance de texte, laissez-le identifier les caractères, puis copiez ou téléchargez le texte obtenu. Comptez quelques minutes, bien moins que de tout retaper.
La situation est familière. Vous devez reprendre une clause d'un bail signé, recopier les informations d'une attestation employeur dans un dossier, ou reporter les montants d'une facture fournisseur dans votre logiciel de comptabilité. Le PDF s'ouvre, tout est lisible, et pourtant le curseur refuse de sélectionner la moindre ligne. Voici pourquoi, comment identifier le type de fichier que vous avez entre les mains, et comment en récupérer le texte proprement.
Pourquoi est-il impossible de sélectionner le texte d'un PDF scanné ?
Un scanner, comme l'appareil photo d'un téléphone, enregistre l'apparence d'une page, pas son contenu. Le résultat porte bien l'extension .pdf, mais chaque page y est stockée comme une image. Vous voyez des lettres à l'écran, le fichier ne contient que des pixels.
C'est ce qui rend le problème si déroutant : le document s'ouvre, s'imprime et s'envoie sans difficulté. Il ne cède qu'au moment où vous voulez utiliser son contenu. La recherche d'un nom ne donne rien, et la sélection d'une phrase attrape toute la page ou rien du tout.
L'OCR fait le lien entre les deux. Il analyse les formes présentes dans l'image, les identifie comme des lettres, des chiffres et des signes de ponctuation, puis les transforme en texte exploitable. Pour comprendre le fonctionnement de cette technologie, consultez notre article consacré à la reconnaissance optique de caractères.
Comment savoir si un PDF contient du texte ou une image ?
Deux vérifications suffisent, et elles vous évitent de lancer une reconnaissance inutile.
Lancez d'abord une recherche (Ctrl+F sur Windows, Cmd+F sur Mac) sur un mot parfaitement visible dans la page. Si votre lecteur PDF le trouve, le texte est déjà présent et vous pouvez le copier directement. Si la recherche reste vide, la page est une image.
Zoomez ensuite à 400 % ou plus. Un vrai texte reste net quel que soit le grossissement, puisqu'il est dessiné à partir des polices de caractères. Un texte scanné devient flou ou pixellisé, car vous agrandissez une photo.
Certains fichiers mélangent les deux. Un rapport exporté depuis un traitement de texte peut contenir une page de signature scannée, par exemple. Dans ce cas, seules les pages scannées ont besoin d'une reconnaissance.
Comment extraire le texte d'un PDF scanné, étape par étape ?
La reconnaissance de texte en ligne fonctionne directement dans votre navigateur, sans installation. Avec PDFSmart, la démarche est la suivante :
- Conservez une copie du scan d'origine, pour pouvoir relancer la reconnaissance si le premier résultat n'est pas satisfaisant.
- Ouvrez l'
- Laissez l'outil reconnaître le texte, puis sélectionnez les passages dont vous avez besoin.
- Copiez le texte dans votre document, ou téléchargez le texte extrait pour le conserver dans un fichier à part.
- Relisez les noms, les montants et les dates avant de les utiliser.
Cette dernière étape mérite une minute. L'OCR est fiable sur une page imprimée et propre, mais un chiffre mal reconnu dans un total de facture ou dans un IBAN passe facilement inaperçu. Comparer les montants extraits au scan prend moins de temps qu'un courriel de rectification.
Quelle méthode choisir selon votre situation ?
La reconnaissance de texte n'est pas la seule façon de récupérer le contenu d'un scan, et le bon choix dépend de la quantité de texte dont vous avez besoin.
Retaper le texte à la main convient pour une ligne isolée, comme une référence de dossier. Au-delà de quelques phrases, l'exercice devient lent et les erreurs s'accumulent.
Copier le texte d'une capture d'écran grâce à une fonction intégrée à votre système d'exploitation dépanne pour un court passage sur une seule page. Cette fonction n'existe pas sur tous les systèmes, et elle ne traite qu'un écran à la fois.
Lancer l'OCR sur le fichier entier avec un outil en ligne est la solution adaptée dès qu'il s'agit de pages complètes à réutiliser. Elle demande un scan lisible, et l'écriture manuscrite est moins bien reconnue que le texte imprimé.
Numériser à nouveau la page s'impose lorsque le scan est flou, penché ou mal éclairé. Encore faut-il avoir conservé l'original papier.
Comment obtenir un texte fiable dès la première reconnaissance ?
La plupart des erreurs viennent du scan, pas de la reconnaissance. Si le texte extrait contient des caractères étranges ou des mots collés, commencez par examiner le fichier d'origine.
Numérisez en 300 ppp (DPI) minimum : en dessous, les petits caractères perdent les détails dont l'OCR a besoin. Posez la page bien à plat et bien droite, car les lignes inclinées se lisent moins bien. Éclairez-la de façon homogène, sans l'ombre de votre main ou de votre téléphone. Enfin, attendez-vous à un résultat nettement plus fiable sur un texte imprimé que sur une écriture manuscrite, qui reste difficile pour l'OCR en général.
Si l'original est encore sous la main, refaire le scan est souvent plus rapide que corriger le texte. Depuis votre téléphone, le scanner mobile PDFSmart transforme la photo d'une page en PDF, que vous pouvez ensuite passer à la reconnaissance de texte. Notre tutoriel pour scanner un document avec un smartphone détaille la prise de vue.
Que faire du texte une fois récupéré ?
Une fois sorti de l'image, le texte se comporte comme n'importe quel autre. Vous pouvez coller une clause dans un courriel, reporter des montants dans un tableur, ou reconstituer le document dans votre traitement de texte pour mettre à jour ce qui a changé depuis l'impression de l'original.
Si ce document reconstitué doit repartir au format PDF, convertissez votre fichier Word en PDF une fois la version finale arrêtée. Vous obtenez un fichier plus léger, dont le texte peut être recherché et copié, ce que le scan ne permettait pas.
Un réflexe à adopter : lorsque vous savez que vous aurez besoin du contenu d'un document, extrayez le texte juste après le scan, tant que le papier est encore à portée de main.
En résumé
Un PDF scanné contient des images, pas du texte, d'où l'impossibilité de sélectionner ou de rechercher quoi que ce soit. Vérifiez le fichier par une simple recherche, passez le scan à la reconnaissance de texte, puis relisez les chiffres avant de les réutiliser. Un scan net en 300 ppp fait l'essentiel du travail.
FAQ (champ FAQ Directus)
Que signifie OCR ?
OCR signifie Optical Character Recognition, soit reconnaissance optique de caractères. La technologie lit les formes présentes dans une image, les identifie comme des lettres, des chiffres et des symboles, puis les convertit en texte que vous pouvez copier, rechercher et modifier.
Pourquoi le texte extrait contient-il des erreurs ?
La qualité du scan est presque toujours en cause. Une résolution trop basse, une page penchée, des ombres ou une impression pâle rendent les caractères plus difficiles à reconnaître. Numérisez à nouveau en 300 ppp minimum avec un éclairage homogène, puis relancez la reconnaissance.
L'OCR peut-il lire une écriture manuscrite ?
La reconnaissance donne ses meilleurs résultats sur un texte imprimé. L'écriture manuscrite varie trop d'une personne à l'autre pour être lue avec la même fiabilité : prévoyez davantage de corrections et comparez toujours le résultat à l'original.
Peut-on extraire le texte d'une photo de document ?
Oui. En plus du PDF, l'outil de reconnaissance de texte PDFSmart accepte les formats d'image courants comme JPG, PNG, TIFF ou WEBP. Une photo de document se traite donc de la même façon qu'un scan.
Faut-il installer un logiciel pour extraire le texte d'un PDF scanné ?
Non. La reconnaissance de texte en ligne fonctionne dans votre navigateur : vous importez le fichier, l'outil reconnaît le texte, puis vous le copiez ou le téléchargez.