CyvoDocOps
Français
Dark

Comment rendre un PDF scanné consultable

Vous scannez quarante pages de vieux contrats, les enregistrez dans un seul et unique fichier PDF bien rangé, et vous cherchez le mot « indemnité ». Ctrl+F ne trouve rien. Vous voyez le mot — il est juste là sur la page douze — mais votre ordinateur ne peut pas, car pour lui, cette page ne contient aucun mot. Elle contient une photographie.

Trois types de PDF qui semblent identiques

Presque toute confusion concernant les scans commence ici. Trois fichiers très différents peuvent apparaître comme étant les mêmes à l'écran :

Le troisième type est celui que vous recherchez, et l'OCR est la méthode pour y parvenir.

En résumé : Un scan est une image de texte. L'OCR lit l'image et retranscrit les mots. Un PDF consultable conserve l'image et glisse discrètement le texte derrière elle.

Ce que fait réellement l'OCR

La reconnaissance optique de caractères examine les pixels, trouve des formes qui ressemblent à des caractères et détermine quels caractères il s'agit. Les moteurs modernes ne comparent pas les lettres une par une comme un pochoir ; ils travaillent le long de lignes de texte, en utilisant les formes et le contexte environnant pour résoudre l'ambiguïté. Ce contexte est la raison pour laquelle un bon moteur lit « rn » comme deux lettres dans « modern », mais pourrait toujours trébucher dessus sur un scan brouillon — il fait une supposition éclairée, à chaque fois.

Ce mot — supposition — est le cœur honnête de l'OCR. Il s'agit d'une lecture probabiliste d'une image, et non d'une conversion sans perte. Généralement une très bonne supposition. Jamais garantie.

Pourquoi un PDF consultable est généralement ce que vous voulez

Vous pourriez faire passer un scan à l'OCR et ne conserver que le texte, mais vous jetteriez le document entier : la signature, l'en-tête, les taches de café, la mise en page — tout ce qui fait qu'il s'agit de l'original plutôt que d'une transcription. Et comme l'OCR est imparfait, une version purement textuelle n'a aucun moyen de se vérifier elle-même.

Un PDF consultable évite ce compromis. L'image scannée reste exactement telle qu'elle était, intacte. Le texte reconnu est ajouté comme une couche invisible positionnée au-dessus des mots auxquels il correspond. Vous voyez l'original ; votre ordinateur voit le texte ; lorsque vous copiez un paragraphe, vous obtenez les mots, et lorsqu'une erreur de reconnaissance s'introduit, la page réelle est toujours là pour servir de référence.

Qu'est-ce qui détermine réellement la précision

La qualité de l'OCR est décidée bien avant que le moteur ne s'exécute — principalement au moment du scan :

Si un scan est de mauvaise qualité, la meilleure solution n'est presque jamais de changer les paramètres d'OCR. C'est de rescanner : plus plat, plus lumineux, plus droit, à 300 dpi. Dix secondes au scanner valent mieux qu'une heure de correction du résultat.

PDF consultable ou texte brut ?

Deux objectifs différents nécessitent deux outils différents, et choisir le mauvais fait perdre du temps :

Si vous n'êtes pas sûr, choisissez le PDF consultable. Vous pourrez toujours en extraire le texte plus tard ; vous ne pouvez pas récupérer une page que vous avez écartée.

Comment procéder

L'OCR dans CyvoDocOps fonctionne sur votre propre appareil — le scan n'est jamais téléversé sur un serveur. Il fait partie de CyvoDocOps Pro, et comme Pro est acheté via l'App Store ou Google Play plutôt que sur le web, les outils OCR sont intégrés à l'application mobile.

  1. Obtenez le meilleur scan possible. 300 dpi, plat, bonne lumière, droit. Cette étape détermine votre résultat plus que toute autre.
  2. Ouvrez le document dans l'application CyvoDocOps. Consultez l'application si vous ne la possédez pas.
  3. Choisissez votre outil. Utilisez PDF consultable pour conserver la page et ajouter la couche cachée ; utilisez Extraire le texte pour en tirer les mots ; ou OCR anglais ou OCR arabe selon la langue que vous lisez.
  4. Vérifiez le résultat. Recherchez un mot que vous savez être sur la page un. S'il n'est pas trouvé, cela signifie que la reconnaissance a eu des difficultés — ce qui renvoie généralement au scan initial.

Télécharger l'application CyvoDocOps

Être clair sur les limites

Arabe et autres écritures

La difficulté de reconnaissance varie énormément selon l'écriture. L'arabe est nettement plus difficile que l'anglais : les lettres se joignent, leurs formes changent en fonction de leur position dans le mot, les diacritiques ont une signification et le texte s'écrit de droite à gauche. Un modèle entraîné pour l'anglais est inutile dessus — vous avez besoin du modèle arabe, via OCR Arabe. Si c'est votre cas d'utilisation, travailler avec des PDF arabes couvre les spécificités.

Pourquoi le traitement sur l'appareil est important ici

Pensez à ce que les gens scannent réellement : contrats, lettres médicales, relevés bancaires, passeports, dossiers fiscaux. Scanner, c'est faire sur des documents qui existent sur papier parce qu'ils sont importants. Envoyer cette pile sur le serveur de quelqu'un d'autre pour traitement est un marché étrange — et courant, car la plupart des services OCR n'ont pas d'autre moyen de fonctionner. Exécuter la reconnaissance sur votre propre appareil garde le document là où il a commencé. Rien n'est téléchargé, donc rien à retenir, enregistrer ou divulguer.

Questions fréquemment posées

Pourquoi ne puis-je pas rechercher dans mon PDF scanné ?

Parce qu'il ne contient aucun texte. Chaque page est une image, et la recherche doit trouver des caractères. L'OCR consiste à transformer l'image en mots que votre ordinateur peut rechercher.

Est-ce que rendre un PDF consultable change son apparence ?

Non. L'image scannée est préservée exactement. Le texte reconnu y est ajouté comme une couche invisible derrière elle.

L'OCR fonctionne-t-il sur l'écriture manuscrite ?

Non. Le moteur est conçu pour le texte imprimé par machine. L'écriture manuscrite est un problème différent et n'est pas un cas d'utilisation pris en charge.

Pourquoi l'OCR se trouve-t-il dans l'application plutôt que dans le navigateur ?

Cela fait partie de CyvoDocOps Pro, et Pro est acheté via l'App Store ou Google Play — il n'y a pas de paiement sur le web — donc les outils résident dans l'application. La reconnaissance s'exécute sur votre appareil dans tous les cas.

Mon scan est-il téléchargé pour l'OCR ?

La reconnaissance s'exécute entièrement sur votre appareil et le document n'est pas envoyé à un serveur.

Guides et outils connexes