CyvoDocOps
Bahasa Indonesia
Dark

Bekerja dengan PDF Bahasa Arab

Anda membuka kontrak berbahasa Arab, memilih sebuah paragraf, menyalinnya, dan menempelkannya ke email. Yang muncul adalah barisan huruf yang terputus — atau urutan huruf yang benar tetapi salah tempat, atau rangkaian karakter yang terlihat hampir benar padahal tidak. PDF-nya ditampilkan dengan sempurna. Namun, saat Anda mencoba mengambil teksnya, teks itu berantakan. Ini bukan berarti perangkat lunak Anda rusak. Ini adalah masalah yang sangat sulit secara inheren.

Mengapa Bahasa Arab Lebih Sulit daripada Aksara Latin

Bahasa Inggris tidak menuntut banyak dari sistem teks: huruf-huruf berbaris, dari kiri ke kanan, dan bentuknya sama di mana pun muncul. Bahasa Arab menuntut jauh lebih banyak, dan setiap fitur ini adalah titik di mana alat sering kali gagal:

Jadi, menampilkan bahasa Arab dengan benar mengharuskan perender (renderer) untuk memilih bentuk yang tepat untuk setiap huruf berdasarkan tetangganya, kemudian menata urutan campuran arah secara koheren. Kedua langkah inilah yang menjadi sumber masalah.

Versi singkatnya: PDF menyimpan gambar huruf dan catatan tentang tempat menggambarnya. Untuk aksara Latin, Anda biasanya dapat bekerja mundur dari gambar ke karakter. Namun, untuk bahasa Arab, jalur ini bersifat kehilangan data — inilah sebabnya mengapa halaman terlihat sempurna tetapi salinannya tidak.

Pembentukan bentuk (Shaping), dan mengapa salin-tempel gagal

Berikut adalah mekanismenya, karena mengetahuinya menjelaskan setiap gejala yang akan Anda temui.

Teks disimpan dalam urutan logis — urutan yang akan Anda ucapkan. Sebelum digambar, perangkat lunak menerapkan shaping: memilih bentuk posisi yang benar untuk setiap huruf, dan bidi (algoritma bidireksional), yang menentukan bagaimana rangkaian dari kanan-ke-kiri dan kiri-ke-kanan saling menyisip di baris.

Namun, PDF tidak menyimpan kalimat Anda. Ia menyimpan glif — indeks ke dalam font — ditambah posisi. Proses pembentukan bentuk sudah terjadi dan tertanam di dalamnya. Untuk menyalin teks keluar, pembaca memerlukan peta dari glif kembali ke karakter, yang mungkin disertakan file sebagai tabel ToUnicode. Dan inilah intinya:

Perhatikan artinya ini: apakah salinan bahasa Arab keluar dari PDF dengan benar diputuskan oleh apa pun yang membuat berkas tersebut, seringkali bertahun-tahun yang lalu. Tidak ada pembaca yang dapat sepenuhnya memulihkan informasi yang dibuang oleh generator.

Apa yang bisa Anda lakukan untuk berkas yang tidak mau memberikan teksnya

  1. Coba ekstrak terlebih dahulu. Jika dokumen dibuat oleh generator yang kompeten, teksnya ada dan dapat disalin dengan bersih. Selalu layak dicoba selama tiga puluh detik sebelum melakukan hal yang lebih berat apa pun.
  2. Coba pembaca yang berbeda. Pembaca berbeda dalam seberapa baik mereka membalikkan *shaping* dan menangani bidi. Berkas yang ditempel dengan buruk dari satu sumber dapat ditempel dengan benar dari sumber lain.
  3. Jika itu hasil pindaian, itu tidak pernah berupa teks. Maka tidak ada jumlah penyalinan yang akan berhasil, dan OCR adalah satu-satunya rute — lihat di bawah.
  4. Jika ekstraksi menghasilkan bentuk presentasi (presentation forms), Anda akan mendapatkan teks, tetapi jenis yang canggung. Teks ini mungkin perlu dinormalisasi sebelum dapat dicari bersama dengan bahasa Arab biasa.

OCR Bahasa Arab: lebih sulit, dan jujur tentang hal itu

Ketika dokumen berupa hasil pindaian (scan), pengenalan adalah satu-satunya jalan — dan ini jauh lebih sulit untuk bahasa Arab dibandingkan dengan bahasa Inggris. Setiap fitur di atas bertentangan dengan mesin: huruf-huruf terhubung, sehingga tidak ada celah bersih untuk dipotong antar karakter; bentuk bervariasi tergantung posisi, memperbanyak apa yang harus dikenali; titik di atas dan di bawah membedakan huruf yang seharusnya identik, jadi sedikit noise pemindai dapat mengubah kata; diakritik mungkin ada atau mungkin tidak.

Konsekuensi praktisnya patut dinyatakan dengan jelas:

OCR berjalan di perangkat Anda sendiri dan merupakan bagian dari CyvoDocOps Pro; karena Pro dibeli melalui App Store atau Google Play alih-alih di web, alat OCR berada di aplikasi seluler. Untuk latar belakang umum tentang cara kerja pengenalan, lihat cara membuat PDF hasil pindaian yang dapat dicari.

Stempel dan anotasi dalam dokumen RTL

Dokumen bisnis Arab sangat bergantung pada stempel dan segel, jauh lebih dari dokumen Barat — persetujuan, tanda terima, dukungan resmi. Menambahkan stempel ke PDF memiliki tantangan tersendiri: teks di dalam stempel memerlukan pembentukan yang benar, dan konvensi penempatan mengikuti arah baca, sehingga stempel yang terlihat alami pada halaman kiri-ke-kanan bisa terlihat janggal pada halaman kanan-ke-kiri.

Stempel Arab menangani pembentukan agar teks ditampilkan sebagai bahasa Arab yang menyambung, bukan barisan huruf terpisah — mode kegagalan yang Anda dapatkan dari alat yang memperlakukan bahasa Arab seolah-olah itu adalah Latin dengan karakter berbeda. Alat terkait seperti stempel tanggal dan inisial mengikuti pola yang sama.

Kebiasaan praktis untuk dokumen Arab

Mengapa pemrosesan lokal penting di sini

Dokumen berbahasa Arab yang membutuhkan jenis pekerjaan ini biasanya adalah dokumen resmi: kontrak, berkas pemerintah, pendaftaran komersial, dokumen identitas, catatan notaris. Itulah kategori tepat di mana mengunggah ke layanan pihak ketiga paling tidak sesuai — dan di mana "kami hapus setelah satu jam" adalah janji yang tidak dapat Anda audit. Di CyvoDocOps, operasi yang didukung berjalan secara lokal di peramban (browser) Anda, dan OCR on-device pada aplikasi seluler memproses hasil pindaian tanpa mengirimkannya ke mana pun. Lihat alat PDF bahasa Arab untuk mengetahui apa saja yang tersedia.

Lihat alat PDF bahasa Arab

Pertanyaan yang sering diajukan

Mengapa teks Arab menjadi terputus saat saya menyalinnya dari PDF?

Karena PDF menyimpan glif pra-bentuk dan peta kembali ke karakter asli hilang atau salah. Halaman tersebut digambar dengan benar; informasi yang dibutuhkan untuk merekonstruksi teks aslinya telah dibuang saat file dibuat.

Mengapa teksnya terbalik saat saya tempelkan?

File tersebut menyimpan glif dalam urutan gambar tanpa informasi yang cukup untuk memulihkan urutan baca. Beberapa pembaca memperbaikinya dengan benar dan beberapa tidak — mencoba pembaca yang berbeda adalah solusi nyata.

Apakah OCR bahasa Arab akurat seperti Bahasa Inggris?

Tidak, dan siapa pun yang mengklaim sebaliknya sedang melebih-lebihkan. Huruf yang terhubung, bentuk yang bergantung pada posisi, dan titik pembawa makna semuanya membuatnya lebih sulit. Pemindaian cetak bersih memberikan hasil bagus yang tetap memerlukan pemeriksaan ulang.

Bisakah saya mencari di PDF pindaian bahasa Arab?

Tidak sampai ada lapisan teks. Jalankan OCR untuk menambahkannya — meskipun perlu diperhatikan bahwa hasil pencarian negatif dalam dokumen yang telah melalui OCR bukanlah bukti bahwa kata tersebut tidak ada.

Apakah dokumen bahasa Arab saya sudah diunggah?

Belum. Operasi web yang didukung berjalan secara lokal di peramban Anda, dan OCR di aplikasi seluler berjalan di perangkat Anda. Dokumen tersebut tidak dikirim ke server.

Panduan & alat terkait