CyvoDocOps
Deutsch
Dark

Arbeiten mit arabischen PDFs

Sie öffnen einen arabischen Vertrag, markieren einen Absatz, kopieren ihn und fĂŒgen ihn in eine E-Mail ein. Was landet, ist eine Reihe getrennter Buchstaben — oder die richtigen Buchstaben in falscher Reihenfolge, oder eine Zeichenkette, die fast richtig aussieht und es nicht ist. Die PDF stellt perfekt dar. In dem Moment, in dem Sie den Text herausnehmen wollen, zerfĂ€llt er. Das ist nicht Ihre Software, die kaputt ist. Es ist ein wirklich schweres Problem, das durchscheint.

Warum Arabisch schwerer ist als lateinische Schrift

Englisch verlangt einem Textsystem wenig ab: Buchstaben sitzen in einer Reihe, von links nach rechts, jeder in derselben Form, wo immer er erscheint. Arabisch verlangt erheblich mehr, und jedes dieser Merkmale ist eine Stelle, an der Werkzeuge schiefgehen:

Arabisch korrekt darzustellen verlangt vom Renderer also, fĂŒr jeden Buchstaben anhand seiner Nachbarn die richtige Form zu wĂ€hlen und dann LĂ€ufe gemischter Richtung stimmig anzuordnen. Beide Schritte sind, woher der Ärger kommt.

Kurzfassung: Eine PDF speichert Bilder von Buchstaben und einen Vermerk, wo sie zu zeichnen sind. FĂŒr lateinische Schrift können Sie meist vom Bild zum Zeichen zurĂŒckrechnen. FĂŒr Arabisch ist dieser Weg verlustbehaftet — weshalb die Seite perfekt aussieht und die Kopie nicht.

Shaping, und warum Kopieren-EinfĂŒgen bricht

Hier der Mechanismus, denn ihn zu kennen erklÀrt jedes Symptom, dem Sie begegnen.

Text wird in logischer Reihenfolge gespeichert — der Reihenfolge, in der Sie ihn sprechen wĂŒrden. Vor dem Zeichnen wendet die Software Shaping an: Auswahl der korrekten positionsabhĂ€ngigen Form fĂŒr jeden Buchstaben, und Bidi (den bidirektionalen Algorithmus), der ausarbeitet, wie Rechts-nach-links- und Links-nach-rechts-LĂ€ufe sich in der Zeile verschrĂ€nken.

Eine PDF speichert jedoch nicht Ihren Satz. Sie speichert Glyphen — Indizes in eine Schrift — plus Positionen. Das Shaping ist bereits geschehen und eingebacken. Um Text wieder herauszukopieren, braucht der Reader eine Karte von der Glyphe zurĂŒck zum Zeichen, die die Datei als ToUnicode-Tabelle enthalten kann. Und das ist der Knackpunkt:

Beachten Sie, was das bedeutet: Ob Arabisch sauber aus einer PDF kopiert, wurde von dem entschieden, was die Datei erzeugte, oft vor Jahren. Kein Reader kann Informationen voll wiederherstellen, die der Generator wegwarf.

Was Sie bei einer Datei tun können, die ihren Text nicht hergibt

  1. Zuerst Extraktion versuchen. Wurde das Dokument von einem fĂ€higen Generator gemacht, ist der Text da und kopiert sauber. Immer dreißig Sekunden wert vor allem Schwereren.
  2. Einen anderen Reader versuchen. Reader unterscheiden sich darin, wie gut sie Shaping umkehren und Bidi handhaben. Eine Datei, die von einem schlecht einfĂŒgt, kann von einem anderen korrekt einfĂŒgen.
  3. Ist es ein Scan, war es nie Text. Dann hilft kein Kopieren, und OCR ist der einzige Weg — siehe unten.
  4. Gibt Extraktion PrÀsentationsformen, haben Sie Text, aber der unbequemen Art. Er muss womöglich normalisiert werden, bevor er neben gewöhnlichem Arabisch durchsuchbar ist.

Arabisches OCR: schwerer, und ehrlich darĂŒber

Ist das Dokument ein Scan, ist Erkennung der einzige Weg — und sie ist fĂŒr Arabisch deutlich schwerer als fĂŒr Englisch. Jedes Merkmal von oben arbeitet gegen die Engine: Buchstaben verbinden sich, es gibt also keine saubere LĂŒcke zum Schneiden zwischen Zeichen; Formen variieren nach Position, was das zu Erkennende vervielfacht; Punkte ĂŒber und unter unterscheiden sonst identische Buchstaben, also kann ein Fleck Scanner-Rauschen das Wort Ă€ndern; Diakritika können da sein oder nicht.

Die praktischen Folgen sind klar zu benennen:

OCR lĂ€uft auf Ihrem eigenen GerĂ€t und ist Teil von CyvoDocOps Pro; weil Pro ĂŒber den App Store oder Google Play gekauft wird statt im Web, leben die OCR-Tools in der Mobile App. FĂŒr den allgemeinen Hintergrund, wie Erkennung funktioniert, siehe eine gescannte PDF durchsuchbar machen.

Stempel und Anmerkungen in RTL-Dokumenten

Arabische GeschĂ€ftsdokumente stĂŒtzen sich weit mehr auf Stempel und Siegel als westliche — Genehmigungen, Quittungen, offizielle BestĂ€tigungen. Sie einer PDF hinzuzufĂŒgen bringt eigene TĂŒcken: Der Text im Stempel braucht korrektes Shaping, und Platzierungskonventionen folgen der Leserichtung, sodass ein Stempel, der auf einer Links-nach-rechts-Seite natĂŒrlich wirkt, auf einer Rechts-nach-links-Seite unbeholfen sitzen kann.

Arabische Stempel ĂŒbernimmt das Shaping, sodass der Text als verbundenes Arabisch statt als Reihe getrennter Buchstaben darstellt — das Versagen, das Sie von Werkzeugen bekommen, die Arabisch behandeln, als wĂ€re es Latein mit anderen Zeichen. Verwandte Werkzeuge wie Datumsstempel und Initialen folgen demselben Muster.

Praktische Gewohnheiten fĂŒr arabische Dokumente

Warum lokale Verarbeitung hier zÀhlt

Arabischsprachige Dokumente, die solche Arbeit brauchen, sind typischerweise die offiziellen: VertrĂ€ge, Behördenpapiere, HandelsregistereintrĂ€ge, Ausweisdokumente, notarielle Aufzeichnungen. Genau die Kategorie, in der das Hochladen zu einem Drittdienst am wenigsten angemessen ist — und wo „wir löschen nach einer Stunde" ein Versprechen ist, das Sie nicht prĂŒfen können. In CyvoDocOps laufen unterstĂŒtzte VorgĂ€nge lokal in Ihrem Browser, und das On-Device-OCR in der Mobile App verarbeitet Scans, ohne sie irgendwohin zu senden. Siehe Arabische PDF-Tools fĂŒr das VerfĂŒgbare.

Die arabischen PDF-Tools ansehen

HĂ€ufige Fragen

Warum kommt arabischer Text getrennt heraus, wenn ich ihn aus einer PDF kopiere?

Weil die PDF vorgeformte Glyphen speichert und die Karte zurĂŒck zu echten Zeichen fehlt oder falsch ist. Die Seite zeichnet korrekt; die zum Rekonstruieren des Originaltexts nötige Information wurde beim Erstellen der Datei verworfen.

Warum ist der Text verkehrt, wenn ich ihn einfĂŒge?

Die Datei speicherte Glyphen in Zeichenreihenfolge ohne genug Information, die Lesereihenfolge wiederherzustellen. Manche Reader kehren es korrekt um, andere nicht — einen anderen Reader zu versuchen ist eine echte Behebung.

Ist arabisches OCR so genau wie englisches?

Nein, und wer anderes behauptet, ĂŒberverkauft. Verbundene Buchstaben, positionsabhĂ€ngige Formen und bedeutungstragende Punkte machen es alle schwerer. Saubere gedruckte Scans geben gute Ergebnisse, die dennoch Korrekturlesen verdienen.

Kann ich eine arabische gescannte PDF durchsuchen?

Nicht, bis sie eine Textschicht hat. FĂŒhren Sie OCR aus, um eine hinzuzufĂŒgen — beachten Sie aber, dass ein negatives Suchergebnis in einem OCR-Dokument kein Beweis ist, dass das Wort fehlt.

Werden meine arabischen Dokumente hochgeladen?

Nein. UnterstĂŒtzte Web-VorgĂ€nge laufen lokal in Ihrem Browser, und OCR in der Mobile App lĂ€uft auf Ihrem GerĂ€t. Das Dokument wird nicht an einen Server gesendet.

Verwandte Ratgeber & Werkzeuge