CyvoDocOps
Français
Dark

Travailler avec les PDF arabes

Vous ouvrez un contrat arabe, vous sélectionnez un paragraphe, vous le copiez et vous le collez dans un e-mail. Ce qui apparaît est une série de lettres déconnectées — ou les bonnes lettres mais dans le mauvais ordre, ou une chaîne de caractères qui semble presque correcte et ne l'est pas. Le PDF s'affiche parfaitement. Au moment où vous essayez d'en extraire le texte, il se désagrège. Ce n'est pas votre logiciel qui est défectueux. C'est un problème intrinsèquement difficile qui apparaît.

Pourquoi l'arabe est plus complexe que l'alphabet latin

L'anglais ne demande pas grand-chose à un système de texte : les lettres sont alignées, de gauche à droite, et ont la même forme où qu'elles apparaissent. L'arabe en exige beaucoup plus, et chacune de ces caractéristiques est une source d'erreurs pour les outils :

Ainsi, afficher l'arabe correctement nécessite que le moteur de rendu sélectionne la bonne forme pour chaque lettre en fonction de ses voisins, puis qu'il dispose les séquences à direction mixte de manière cohérente. Les deux étapes sont sources de problèmes.

La version courte : un PDF stocke des images de lettres et une note sur l'endroit où les dessiner. Pour le script latin, vous pouvez généralement travailler à rebours de l'image vers le caractère. Pour l'arabe, ce chemin est sujet à perte — c'est pourquoi la page semble parfaite mais que le copier-coller ne fonctionne pas.

Le façonnage et pourquoi le copier-coller échoue

Voici le mécanisme, car le connaître explique chaque symptôme que vous rencontrerez.

Le texte est stocké dans un ordre logique — l'ordre où vous le diriez. Avant de dessiner, le logiciel applique le façonnage (shaping) : en choisissant la forme positionnelle correcte pour chaque lettre, et le bidi (l'algorithme bidirectionnel), qui détermine comment les séquences de droite à gauche et de gauche à droite s'entremêlent sur la ligne.

Un PDF, cependant, ne stocke pas votre phrase. Il stocke des glyphes — des indices dans une police — plus des positions. Le façonnage a déjà eu lieu et est intégré. Pour copier le texte à nouveau, le lecteur a besoin d'une carte du glyphe au caractère, que le fichier peut inclure sous forme de table ToUnicode. Et c'est là tout le problème :

Veuillez noter ce qui suit : si la copie de l'arabe à partir d'un PDF est correcte dépend du programme qui a généré le fichier, souvent il y a des années. Aucun lecteur ne peut récupérer toutes les informations que le générateur a supprimées.

Ce que vous pouvez faire face à un fichier qui refuse de donner son texte

  1. Essayez d'extraire en premier. Si le document a été créé par un générateur compétent, le texte est présent et se copie proprement. Cela vaut toujours trente secondes avant toute autre démarche plus lourde.
  2. Essayez un lecteur différent. Les lecteurs diffèrent dans la manière dont ils inversent le façonnage et gèrent le bidi. Un fichier qui colle mal depuis un lecteur peut coller correctement depuis un autre.
  3. S'il s'agit d'un scan, ce n'était jamais du texte. Alors aucune quantité de copier-coller ne fonctionnera, et l'OCR est la seule solution — voir ci-dessous.
  4. Si l'extraction donne des formulaires de présentation, vous avez du texte, mais un type peu naturel. Il pourrait nécessiter une normalisation avant d'être interrogeable avec le texte arabe ordinaire.

OCR Arabe : plus difficile, et il faut l'admettre

Lorsque le document est un scan, la reconnaissance est la seule voie — et elle est nettement plus difficile pour l'arabe que pour l'anglais. Chaque caractéristique ci-dessus travaille contre le moteur : les lettres se connectent, il n'y a donc pas d'espace net à couper entre les caractères ; les formes varient selon la position, multipliant ce qui doit être reconnu ; des points au-dessus et en dessous distinguent des lettres autrement identiques, de sorte qu'un grain de bruit de scanner peut changer le mot ; les diacritiques peuvent ou non être présents.

Les conséquences pratiques méritent d'être énoncées clairement :

L'OCR s'exécute sur votre propre appareil et fait partie de CyvoDocOps Pro ; comme Pro est acheté via l'App Store ou Google Play plutôt que sur le web, les outils OCR sont intégrés à l'application mobile. Pour des informations générales sur le fonctionnement de la reconnaissance, veuillez consulter comment rendre un PDF scanné consultable.

Cachets et annotations dans les documents RTL

Les documents commerciaux arabes reposent beaucoup plus sur des cachets et des sceaux que les documents occidentaux — approbations, reçus, endorsements officiels. Leur ajout à un PDF présente ses propres difficultés : le texte à l'intérieur du cachet doit avoir une mise en forme correcte, et les conventions de placement suivent la direction de lecture, un cachet qui semble naturel sur une page de gauche à droite peut être mal placé sur une page de droite à gauche.

Cachets arabes gère la mise en forme pour que le texte s'affiche comme un arabe joint plutôt qu'une ligne de lettres séparées — c'est le mode d'échec obtenu avec des outils qui traitent l'arabe comme s'il s'agissait du latin avec différents caractères. Des outils connexes tels que les cachets de date et les initiales suivent le même modèle.

Habitudes pratiques pour les documents arabes

Pourquoi le traitement local est important ici

Les documents en langue arabe nécessitant ce type de travail sont généralement des documents officiels : contrats, papiers gouvernementaux, enregistrements commerciaux, pièces d'identité, dossiers notariés. C'est précisément la catégorie où le téléchargement vers un service tiers est le moins approprié — et où « nous supprimons après une heure » est une promesse que vous ne pouvez pas auditer. Dans CyvoDocOps, les opérations prises en charge s'exécutent localement dans votre navigateur, et l'OCR sur l'appareil de l'application mobile traite les scans sans les envoyer nulle part. Consultez les outils PDF arabes pour ce qui est disponible.

Voir les outils PDF arabes

Questions fréquemment posées

Pourquoi le texte arabe apparaît-il déconnecté lorsque je le copie d'un PDF ?

Parce que le PDF stocke des glyphes préformés et que la carte vers les caractères réels est manquante ou incorrecte. La page s'affiche correctement ; l'information nécessaire pour reconstruire le texte original a été abandonnée lors de la création du fichier.

Pourquoi le texte est-il à l'envers lorsque je le colle ?

Le fichier stocke les glyphes dans l'ordre de dessin sans suffisamment d'informations pour récupérer l'ordre de lecture. Certains lecteurs l'inversent correctement et d'autres non — essayer un autre lecteur est une véritable solution.

L'OCR arabe est-il aussi précis que celui de l'anglais ?

Non, et quiconque prétend le contraire surestime la situation. Les lettres connectées, les formes dépendantes de la position et les points porteurs de sens rendent tout cela plus difficile. Des scans imprimés propres donnent de bons résultats qui méritent néanmoins une relecture.

Puis-je rechercher dans un PDF scanné en arabe ?

Pas tant qu'il ne dispose pas d'une couche de texte. Exécutez l'OCR pour en ajouter une — notez cependant qu'un résultat de recherche négatif dans un document traité par OCR n'est pas la preuve que le mot est absent.

Mes documents arabes ont-ils été téléchargés ?

Non. Les opérations web prises en charge s'exécutent localement dans votre navigateur, et l'OCR dans l'application mobile s'exécute sur votre appareil. Le document n'est pas envoyé à un serveur.

Guides et outils connexes