Comment rendre un PDF scanné consultable
Vous scannez quarante pages de vieux contrats, les enregistrez dans un seul et unique fichier PDF bien rangé, et vous cherchez le mot « indemnité ». Ctrl+F ne trouve rien. Vous voyez le mot — il est juste là sur la page douze — mais votre ordinateur ne peut pas, car pour lui, cette page ne contient aucun mot. Elle contient une photographie.
Trois types de PDF qui semblent identiques
Presque toute confusion concernant les scans commence ici. Trois fichiers très différents peuvent apparaître comme étant les mêmes à l'écran :
- Un PDF natif numérique. Exporté depuis un traitement de texte. Il stocke des caractères réels avec des polices réelles. La recherche, la sélection et le copier fonctionnent car le texte est véritablement du texte.
- Un PDF image uniquement. Provenant d'un scanner ou d'un appareil photo de téléphone. Chaque page est une grande image unique. Il n'y a pas de texte dans le fichier — seulement des pixels disposés pour ressembler à du texte. C'est ce qui rend Ctrl+F inefficace.
- Un PDF consultable (searchable). Le scan plus une couche de texte invisible. Il ressemble exactement à la version image uniquement — même photo, même page — mais le texte est placé derrière, ce qui permet la recherche et le copier-coller.
Le troisième type est celui que vous recherchez, et l'OCR est la méthode pour y parvenir.
Ce que fait réellement l'OCR
La reconnaissance optique de caractères examine les pixels, trouve des formes qui ressemblent à des caractères et détermine quels caractères il s'agit. Les moteurs modernes ne comparent pas les lettres une par une comme un pochoir ; ils travaillent le long de lignes de texte, en utilisant les formes et le contexte environnant pour résoudre l'ambiguïté. Ce contexte est la raison pour laquelle un bon moteur lit « rn » comme deux lettres dans « modern », mais pourrait toujours trébucher dessus sur un scan brouillon — il fait une supposition éclairée, à chaque fois.
Ce mot — supposition — est le cœur honnête de l'OCR. Il s'agit d'une lecture probabiliste d'une image, et non d'une conversion sans perte. Généralement une très bonne supposition. Jamais garantie.
Pourquoi un PDF consultable est généralement ce que vous voulez
Vous pourriez faire passer un scan à l'OCR et ne conserver que le texte, mais vous jetteriez le document entier : la signature, l'en-tête, les taches de café, la mise en page — tout ce qui fait qu'il s'agit de l'original plutôt que d'une transcription. Et comme l'OCR est imparfait, une version purement textuelle n'a aucun moyen de se vérifier elle-même.
Un PDF consultable évite ce compromis. L'image scannée reste exactement telle qu'elle était, intacte. Le texte reconnu est ajouté comme une couche invisible positionnée au-dessus des mots auxquels il correspond. Vous voyez l'original ; votre ordinateur voit le texte ; lorsque vous copiez un paragraphe, vous obtenez les mots, et lorsqu'une erreur de reconnaissance s'introduit, la page réelle est toujours là pour servir de référence.
Qu'est-ce qui détermine réellement la précision
La qualité de l'OCR est décidée bien avant que le moteur ne s'exécute — principalement au moment du scan :
- Résolution. Environ 300 dpi est l'idéal pour le texte imprimé. En dessous de 200, les caractères perdent le détail nécessaire à leur distinction. Au-delà de 400, vous ne faites qu'augmenter la taille du fichier, sans améliorer la lecture.
- Contraste. Un noir net sur un blanc immaculé est idéal. Les photocopies grisées, le papier coloré et les ombres sur la page réduisent tous votre précision.
- Alignement. La déformation (skew) est un véritable ennemi. Une page photographiée en biais, ou avec la courbure d'un livre près de la reliure, donne au moteur des lignes de base incurvées à suivre.
- Qualité d'impression. Une impression machine propre est bien lue. Les fax, les photocopies de troisième génération, les sorties à points et le texte tamponné sont beaucoup moins lisibles.
- La bonne langue. Le moteur utilise un modèle linguistique pour résoudre l'ambiguïté. Exécuter un modèle anglais sur un document français dégrade les résultats même si l'alphabet correspond.
- L'écriture manuscrite — à éviter. Ce moteur est conçu pour le texte imprimé par machine. La reconnaissance de l'écriture manuelle est un problème véritablement différent et n'est pas un cas d'utilisation pris en charge. Si votre document est écrit à la main, l'OCR produira des absurdités avec assurance. 」}{
Si un scan est de mauvaise qualité, la meilleure solution n'est presque jamais de changer les paramètres d'OCR. C'est de rescanner : plus plat, plus lumineux, plus droit, à 300 dpi. Dix secondes au scanner valent mieux qu'une heure de correction du résultat.
PDF consultable ou texte brut ?
Deux objectifs différents nécessitent deux outils différents, et choisir le mauvais fait perdre du temps :
- Vous voulez que le document reste un document — consultable, copiable, archivé, qui ressemble toujours à l'original. C'est un PDF consultable. Idéal pour les contrats, les dossiers, tout ce que vous pourriez avoir besoin de produire plus tard tel quel.
- Vous voulez extraire le texte — pour le coller dans un e-mail, l'alimenter dans une feuille de calcul, ou le citer dans un rapport. C'est « Extraire du texte », qui vous donne du texte brut et ignore la mise en page.
Si vous n'êtes pas sûr, choisissez le PDF consultable. Vous pourrez toujours en extraire le texte plus tard ; vous ne pouvez pas récupérer une page que vous avez écartée.
Comment procéder
L'OCR dans CyvoDocOps fonctionne sur votre propre appareil — le scan n'est jamais téléversé sur un serveur. Il fait partie de CyvoDocOps Pro, et comme Pro est acheté via l'App Store ou Google Play plutôt que sur le web, les outils OCR sont intégrés à l'application mobile.
- Obtenez le meilleur scan possible. 300 dpi, plat, bonne lumière, droit. Cette étape détermine votre résultat plus que toute autre.
- Ouvrez le document dans l'application CyvoDocOps. Consultez l'application si vous ne la possédez pas.
- Choisissez votre outil. Utilisez PDF consultable pour conserver la page et ajouter la couche cachée ; utilisez Extraire le texte pour en tirer les mots ; ou OCR anglais ou OCR arabe selon la langue que vous lisez.
- Vérifiez le résultat. Recherchez un mot que vous savez être sur la page un. S'il n'est pas trouvé, cela signifie que la reconnaissance a eu des difficultés — ce qui renvoie généralement au scan initial.
Télécharger l'application CyvoDocOps
Être clair sur les limites
- L'OCR n'est jamais précis à 100 %. Même sur des scans propres, il y a des erreurs — un chiffre mal lu, un trait d'union manquant. Le bon n'est pas parfait, et l'écart est important lorsqu'il s'agit d'un montant de paiement.
- Ne faites pas confiance à une recherche négative. Si Ctrl+F ne trouve pas « indemnité », cela peut signifier que le mot n'y est pas, ou qu'OCR l'a lu comme « indernité ». L'absence de résultat n'est pas la preuve de l'absence dans un document traité par OCR — une distinction importante si vous recherchez des dossiers à des fins juridiques ou médicales.
- Les tableaux et les colonnes sont difficiles. La reconnaissance suit les lignes de texte ; des mises en page complexes peuvent imbriquer les colonnes ou brouiller les cellules de tableau même lorsque chaque caractère individuel est lu correctement.
- La couche de texte peut être fausse alors que la page est correcte. C'est le fonctionnement prévu du design — l'image est l'enregistrement, le texte est l'index — mais ne citez pas à partir de la couche sans regarder la page.
Arabe et autres écritures
La difficulté de reconnaissance varie énormément selon l'écriture. L'arabe est nettement plus difficile que l'anglais : les lettres se joignent, leurs formes changent en fonction de leur position dans le mot, les diacritiques ont une signification et le texte s'écrit de droite à gauche. Un modèle entraîné pour l'anglais est inutile dessus — vous avez besoin du modèle arabe, via OCR Arabe. Si c'est votre cas d'utilisation, travailler avec des PDF arabes couvre les spécificités.
Pourquoi le traitement sur l'appareil est important ici
Pensez à ce que les gens scannent réellement : contrats, lettres médicales, relevés bancaires, passeports, dossiers fiscaux. Scanner, c'est faire sur des documents qui existent sur papier parce qu'ils sont importants. Envoyer cette pile sur le serveur de quelqu'un d'autre pour traitement est un marché étrange — et courant, car la plupart des services OCR n'ont pas d'autre moyen de fonctionner. Exécuter la reconnaissance sur votre propre appareil garde le document là où il a commencé. Rien n'est téléchargé, donc rien à retenir, enregistrer ou divulguer.
Questions fréquemment posées
Pourquoi ne puis-je pas rechercher dans mon PDF scanné ?
Parce qu'il ne contient aucun texte. Chaque page est une image, et la recherche doit trouver des caractères. L'OCR consiste à transformer l'image en mots que votre ordinateur peut rechercher.
Est-ce que rendre un PDF consultable change son apparence ?
Non. L'image scannée est préservée exactement. Le texte reconnu y est ajouté comme une couche invisible derrière elle.
L'OCR fonctionne-t-il sur l'écriture manuscrite ?
Non. Le moteur est conçu pour le texte imprimé par machine. L'écriture manuscrite est un problème différent et n'est pas un cas d'utilisation pris en charge.
Pourquoi l'OCR se trouve-t-il dans l'application plutôt que dans le navigateur ?
Cela fait partie de CyvoDocOps Pro, et Pro est acheté via l'App Store ou Google Play — il n'y a pas de paiement sur le web — donc les outils résident dans l'application. La reconnaissance s'exécute sur votre appareil dans tous les cas.
Mon scan est-il téléchargé pour l'OCR ?
La reconnaissance s'exécute entièrement sur votre appareil et le document n'est pas envoyé à un serveur.