Arbeiten mit arabischen PDFs
Sie öffnen einen arabischen Vertrag, markieren einen Absatz, kopieren ihn und fĂŒgen ihn in eine E-Mail ein. Was landet, ist eine Reihe getrennter Buchstaben â oder die richtigen Buchstaben in falscher Reihenfolge, oder eine Zeichenkette, die fast richtig aussieht und es nicht ist. Die PDF stellt perfekt dar. In dem Moment, in dem Sie den Text herausnehmen wollen, zerfĂ€llt er. Das ist nicht Ihre Software, die kaputt ist. Es ist ein wirklich schweres Problem, das durchscheint.
Warum Arabisch schwerer ist als lateinische Schrift
Englisch verlangt einem Textsystem wenig ab: Buchstaben sitzen in einer Reihe, von links nach rechts, jeder in derselben Form, wo immer er erscheint. Arabisch verlangt erheblich mehr, und jedes dieser Merkmale ist eine Stelle, an der Werkzeuge schiefgehen:
- Es ist von Natur aus verbunden. Buchstaben verbinden sich. Das ist nicht dekorativ â so funktioniert die Schrift.
- Buchstaben Àndern die Form je nach Position. Ein einzelner Buchstabe kann bis zu vier Formen haben: allein stehend, am Wortanfang, in der Mitte, am Ende. Gleicher Buchstabe, gleiche Bedeutung, vier verschiedene Bilder.
- Es lĂ€uft von rechts nach links â aber nicht alles tut das. Zahlen und eingebettete lateinische Wörter laufen von links nach rechts innerhalb von Rechts-nach-links-Text.
- Diakritika sind optional und bedeutungstragend. Kurzvokalzeichen können vorhanden oder abwesend sein, und sie Àndern die Lesung.
Arabisch korrekt darzustellen verlangt vom Renderer also, fĂŒr jeden Buchstaben anhand seiner Nachbarn die richtige Form zu wĂ€hlen und dann LĂ€ufe gemischter Richtung stimmig anzuordnen. Beide Schritte sind, woher der Ărger kommt.
Shaping, und warum Kopieren-EinfĂŒgen bricht
Hier der Mechanismus, denn ihn zu kennen erklÀrt jedes Symptom, dem Sie begegnen.
Text wird in logischer Reihenfolge gespeichert â der Reihenfolge, in der Sie ihn sprechen wĂŒrden. Vor dem Zeichnen wendet die Software Shaping an: Auswahl der korrekten positionsabhĂ€ngigen Form fĂŒr jeden Buchstaben, und Bidi (den bidirektionalen Algorithmus), der ausarbeitet, wie Rechts-nach-links- und Links-nach-rechts-LĂ€ufe sich in der Zeile verschrĂ€nken.
Eine PDF speichert jedoch nicht Ihren Satz. Sie speichert Glyphen â Indizes in eine Schrift â plus Positionen. Das Shaping ist bereits geschehen und eingebacken. Um Text wieder herauszukopieren, braucht der Reader eine Karte von der Glyphe zurĂŒck zum Zeichen, die die Datei als ToUnicode-Tabelle enthalten kann. Und das ist der Knackpunkt:
- Keine Karte, kein Text. Hat der Generator keine eingefĂŒgt, liefert die Extraktion Glyphennummern, keine Buchstaben. Sie bekommen MĂŒll, der gut darstellt und nichts bedeutet.
- Eine Karte zum Falschen. Manche Generatoren bilden Glyphen auf PrĂ€sentationsformen ab â einen alten Unicode-Block, der jede vorgeformte Variante separat hĂ€lt. So extrahierter Text sieht am Bildschirm korrekt aus, ist aber kein normales Arabisch: Suche passt nicht, und andere Software behandelt ihn nicht richtig.
- Reihenfolge verloren. Speichert die Datei Glyphen in visueller Reihenfolge ohne die Information, sie umzukehren, bekommen Sie Buchstaben in Zeichenreihenfolge statt Lesereihenfolge â das klassische âverkehrte" EinfĂŒgen.
- Verbindungen gebrochen. Extraktion, die isolierte Buchstaben ohne ihre Verbindungen wiederherstellt, erzeugt jene Reihe getrennter Zeichen, jedes einzeln korrekt.
Beachten Sie, was das bedeutet: Ob Arabisch sauber aus einer PDF kopiert, wurde von dem entschieden, was die Datei erzeugte, oft vor Jahren. Kein Reader kann Informationen voll wiederherstellen, die der Generator wegwarf.
Was Sie bei einer Datei tun können, die ihren Text nicht hergibt
- Zuerst Extraktion versuchen. Wurde das Dokument von einem fĂ€higen Generator gemacht, ist der Text da und kopiert sauber. Immer dreiĂig Sekunden wert vor allem Schwereren.
- Einen anderen Reader versuchen. Reader unterscheiden sich darin, wie gut sie Shaping umkehren und Bidi handhaben. Eine Datei, die von einem schlecht einfĂŒgt, kann von einem anderen korrekt einfĂŒgen.
- Ist es ein Scan, war es nie Text. Dann hilft kein Kopieren, und OCR ist der einzige Weg â siehe unten.
- Gibt Extraktion PrÀsentationsformen, haben Sie Text, aber der unbequemen Art. Er muss womöglich normalisiert werden, bevor er neben gewöhnlichem Arabisch durchsuchbar ist.
Arabisches OCR: schwerer, und ehrlich darĂŒber
Ist das Dokument ein Scan, ist Erkennung der einzige Weg â und sie ist fĂŒr Arabisch deutlich schwerer als fĂŒr Englisch. Jedes Merkmal von oben arbeitet gegen die Engine: Buchstaben verbinden sich, es gibt also keine saubere LĂŒcke zum Schneiden zwischen Zeichen; Formen variieren nach Position, was das zu Erkennende vervielfacht; Punkte ĂŒber und unter unterscheiden sonst identische Buchstaben, also kann ein Fleck Scanner-Rauschen das Wort Ă€ndern; Diakritika können da sein oder nicht.
Die praktischen Folgen sind klar zu benennen:
- ScanqualitĂ€t zĂ€hlt noch mehr als sonst. 300 dpi, hoher Kontrast, gerade. Bei Arabisch verfĂ€llt ein mittelmĂ€Ăiger Scan nicht gnĂ€dig.
- Nutzen Sie das arabische Modell. OCR Arabisch â ein englisches Modell auf arabischem Text erzeugt nichts Brauchbares.
- Rechnen Sie mit Korrekturlesen. Sauber maschinengedrucktes Arabisch liefert gute Ergebnisse. Gut ist nicht perfekt, und die Fehler sind eher Ein-Punkt-Unterschiede, die die Bedeutung Àndern, als offensichtlicher Unsinn.
- Handschrift ist ausgeschlossen. In keiner Sprache ein unterstĂŒtzter Anwendungsfall, arabische Handschrift besonders.
OCR lĂ€uft auf Ihrem eigenen GerĂ€t und ist Teil von CyvoDocOps Pro; weil Pro ĂŒber den App Store oder Google Play gekauft wird statt im Web, leben die OCR-Tools in der Mobile App. FĂŒr den allgemeinen Hintergrund, wie Erkennung funktioniert, siehe eine gescannte PDF durchsuchbar machen.
Stempel und Anmerkungen in RTL-Dokumenten
Arabische GeschĂ€ftsdokumente stĂŒtzen sich weit mehr auf Stempel und Siegel als westliche â Genehmigungen, Quittungen, offizielle BestĂ€tigungen. Sie einer PDF hinzuzufĂŒgen bringt eigene TĂŒcken: Der Text im Stempel braucht korrektes Shaping, und Platzierungskonventionen folgen der Leserichtung, sodass ein Stempel, der auf einer Links-nach-rechts-Seite natĂŒrlich wirkt, auf einer Rechts-nach-links-Seite unbeholfen sitzen kann.
Arabische Stempel ĂŒbernimmt das Shaping, sodass der Text als verbundenes Arabisch statt als Reihe getrennter Buchstaben darstellt â das Versagen, das Sie von Werkzeugen bekommen, die Arabisch behandeln, als wĂ€re es Latein mit anderen Zeichen. Verwandte Werkzeuge wie Datumsstempel und Initialen folgen demselben Muster.
Praktische Gewohnheiten fĂŒr arabische Dokumente
- Behalten Sie die Quelle. Das Original aus der Software, die es machte, gibt immer besseren Text als alles spÀter Wiederhergestellte.
- Testen Sie Extraktion vor dem Festlegen. HĂ€ngt ein Arbeitsablauf am Durchsuchen arabischer PDFs, prĂŒfen Sie, dass Text tatsĂ€chlich aus einem Muster herauskommt, bevor Sie darum herum bauen.
- Bevorzugen Sie echten Text vor Scans. Eine digital erzeugte arabische PDF schlÀgt jedes Mal einen Scan. Scannen Sie nur, wenn Papier die einzige Quelle ist.
- Achten Sie auf gemischten Inhalt. Dokumente, die Arabisch mit englischen Begriffen, Rechnungsnummern und Daten kombinieren, sind, wo sich Bidi-Probleme bĂŒndeln. PrĂŒfen Sie diese Zeilen gezielt.
- Urteilen Sie nicht nach dem Aussehen. Eine Datei, die schön darstellt, kann trotzdem ein Scan sein oder eine unbrauchbare Textschicht tragen. Versuchen Sie, ein Wort zu markieren â hebt sich nichts hervor, ist es ein Bild.
Warum lokale Verarbeitung hier zÀhlt
Arabischsprachige Dokumente, die solche Arbeit brauchen, sind typischerweise die offiziellen: VertrĂ€ge, Behördenpapiere, HandelsregistereintrĂ€ge, Ausweisdokumente, notarielle Aufzeichnungen. Genau die Kategorie, in der das Hochladen zu einem Drittdienst am wenigsten angemessen ist â und wo âwir löschen nach einer Stunde" ein Versprechen ist, das Sie nicht prĂŒfen können. In CyvoDocOps laufen unterstĂŒtzte VorgĂ€nge lokal in Ihrem Browser, und das On-Device-OCR in der Mobile App verarbeitet Scans, ohne sie irgendwohin zu senden. Siehe Arabische PDF-Tools fĂŒr das VerfĂŒgbare.
Die arabischen PDF-Tools ansehen
HĂ€ufige Fragen
Warum kommt arabischer Text getrennt heraus, wenn ich ihn aus einer PDF kopiere?
Weil die PDF vorgeformte Glyphen speichert und die Karte zurĂŒck zu echten Zeichen fehlt oder falsch ist. Die Seite zeichnet korrekt; die zum Rekonstruieren des Originaltexts nötige Information wurde beim Erstellen der Datei verworfen.
Warum ist der Text verkehrt, wenn ich ihn einfĂŒge?
Die Datei speicherte Glyphen in Zeichenreihenfolge ohne genug Information, die Lesereihenfolge wiederherzustellen. Manche Reader kehren es korrekt um, andere nicht â einen anderen Reader zu versuchen ist eine echte Behebung.
Ist arabisches OCR so genau wie englisches?
Nein, und wer anderes behauptet, ĂŒberverkauft. Verbundene Buchstaben, positionsabhĂ€ngige Formen und bedeutungstragende Punkte machen es alle schwerer. Saubere gedruckte Scans geben gute Ergebnisse, die dennoch Korrekturlesen verdienen.
Kann ich eine arabische gescannte PDF durchsuchen?
Nicht, bis sie eine Textschicht hat. FĂŒhren Sie OCR aus, um eine hinzuzufĂŒgen â beachten Sie aber, dass ein negatives Suchergebnis in einem OCR-Dokument kein Beweis ist, dass das Wort fehlt.
Werden meine arabischen Dokumente hochgeladen?
Nein. UnterstĂŒtzte Web-VorgĂ€nge laufen lokal in Ihrem Browser, und OCR in der Mobile App lĂ€uft auf Ihrem GerĂ€t. Das Dokument wird nicht an einen Server gesendet.