Bekerja dengan PDF Bahasa Arab
Anda membuka kontrak berbahasa Arab, memilih sebuah paragraf, menyalinnya, dan menempelkannya ke email. Yang muncul adalah barisan huruf yang terputus — atau urutan huruf yang benar tetapi salah tempat, atau rangkaian karakter yang terlihat hampir benar padahal tidak. PDF-nya ditampilkan dengan sempurna. Namun, saat Anda mencoba mengambil teksnya, teks itu berantakan. Ini bukan berarti perangkat lunak Anda rusak. Ini adalah masalah yang sangat sulit secara inheren.
Mengapa Bahasa Arab Lebih Sulit daripada Aksara Latin
Bahasa Inggris tidak menuntut banyak dari sistem teks: huruf-huruf berbaris, dari kiri ke kanan, dan bentuknya sama di mana pun muncul. Bahasa Arab menuntut jauh lebih banyak, dan setiap fitur ini adalah titik di mana alat sering kali gagal:
- Secara alami bersambung (cursive). Huruf-huruf saling terhubung. Ini bukan sekadar hiasan — ini adalah cara kerja aksaranya.
- Bentuk huruf berubah sesuai posisi. Satu huruf dapat memiliki hingga empat bentuk: berdiri sendiri, di awal kata, di tengah, dan di akhir. Huruf yang sama, makna yang sama, namun dengan empat tampilan berbeda.
- Berjalan dari kanan ke kiri — tetapi tidak semuanya. Angka dan kata Latin yang disematkan berjalan dari kiri ke kanan di dalam teks yang berarah kanan-ke-kiri.
- Diakritics bersifat opsional dan bermakna. Tanda vokal pendek mungkin ada atau tidak, dan tanda tersebut mengubah cara membacanya.
Jadi, menampilkan bahasa Arab dengan benar mengharuskan perender (renderer) untuk memilih bentuk yang tepat untuk setiap huruf berdasarkan tetangganya, kemudian menata urutan campuran arah secara koheren. Kedua langkah inilah yang menjadi sumber masalah.
Pembentukan bentuk (Shaping), dan mengapa salin-tempel gagal
Berikut adalah mekanismenya, karena mengetahuinya menjelaskan setiap gejala yang akan Anda temui.
Teks disimpan dalam urutan logis — urutan yang akan Anda ucapkan. Sebelum digambar, perangkat lunak menerapkan shaping: memilih bentuk posisi yang benar untuk setiap huruf, dan bidi (algoritma bidireksional), yang menentukan bagaimana rangkaian dari kanan-ke-kiri dan kiri-ke-kanan saling menyisip di baris.
Namun, PDF tidak menyimpan kalimat Anda. Ia menyimpan glif — indeks ke dalam font — ditambah posisi. Proses pembentukan bentuk sudah terjadi dan tertanam di dalamnya. Untuk menyalin teks keluar, pembaca memerlukan peta dari glif kembali ke karakter, yang mungkin disertakan file sebagai tabel ToUnicode. Dan inilah intinya:
- Tidak ada peta, tidak ada teks. Jika generator tidak menyertakannya, ekstraksi akan menghasilkan nomor glif, bukan huruf. Anda mendapatkan sampah yang tampilannya bagus tetapi tidak berarti apa-apa.
- Peta ke hal yang salah. Beberapa generator memetakan glif ke bentuk presentasi — blok Unicode warisan yang menyimpan setiap varian pra-dibentuk secara terpisah. Teks yang diekstrak dengan cara ini terlihat benar di layar tetapi bukan bahasa Arab normal: pencarian tidak akan mencocokkannya, dan perangkat lunak lain juga tidak akan menanganinya dengan benar.
- Urutan hilang. Jika berkas menyimpan glif dalam urutan visual tanpa informasi untuk membalikkan urutannya, Anda mendapatkan huruf-huruf dalam urutan menggambar alih-alih urutan membaca — seperti menempel yang klasik "terbalik".
- Sambungan rusak. Ekstraksi yang memulihkan huruf-huruf terisolasi tanpa koneksinya menghasilkan baris karakter yang terputus, di mana setiap karakter secara individual benar.
Perhatikan artinya ini: apakah salinan bahasa Arab keluar dari PDF dengan benar diputuskan oleh apa pun yang membuat berkas tersebut, seringkali bertahun-tahun yang lalu. Tidak ada pembaca yang dapat sepenuhnya memulihkan informasi yang dibuang oleh generator.
Apa yang bisa Anda lakukan untuk berkas yang tidak mau memberikan teksnya
- Coba ekstrak terlebih dahulu. Jika dokumen dibuat oleh generator yang kompeten, teksnya ada dan dapat disalin dengan bersih. Selalu layak dicoba selama tiga puluh detik sebelum melakukan hal yang lebih berat apa pun.
- Coba pembaca yang berbeda. Pembaca berbeda dalam seberapa baik mereka membalikkan *shaping* dan menangani bidi. Berkas yang ditempel dengan buruk dari satu sumber dapat ditempel dengan benar dari sumber lain.
- Jika itu hasil pindaian, itu tidak pernah berupa teks. Maka tidak ada jumlah penyalinan yang akan berhasil, dan OCR adalah satu-satunya rute — lihat di bawah.
- Jika ekstraksi menghasilkan bentuk presentasi (presentation forms), Anda akan mendapatkan teks, tetapi jenis yang canggung. Teks ini mungkin perlu dinormalisasi sebelum dapat dicari bersama dengan bahasa Arab biasa.
OCR Bahasa Arab: lebih sulit, dan jujur tentang hal itu
Ketika dokumen berupa hasil pindaian (scan), pengenalan adalah satu-satunya jalan — dan ini jauh lebih sulit untuk bahasa Arab dibandingkan dengan bahasa Inggris. Setiap fitur di atas bertentangan dengan mesin: huruf-huruf terhubung, sehingga tidak ada celah bersih untuk dipotong antar karakter; bentuk bervariasi tergantung posisi, memperbanyak apa yang harus dikenali; titik di atas dan di bawah membedakan huruf yang seharusnya identik, jadi sedikit noise pemindai dapat mengubah kata; diakritik mungkin ada atau mungkin tidak.
Konsekuensi praktisnya patut dinyatakan dengan jelas:
- Kualitas pindaian sangat penting, bahkan lebih dari biasanya. 300 dpi, kontras tinggi, lurus. Untuk bahasa Arab, hasil pindaian yang biasa saja tidak akan menurun secara anggun.
- Gunakan model Bahasa Arab. OCR Bahasa Arab — model bahasa Inggris pada teks Arab tidak menghasilkan apa pun yang berguna.
- Bersiaplah untuk melakukan proofreading (koreksi). Teks Arab cetak mesin yang bersih akan memberikan hasil yang baik. Baik tidak berarti sempurna, dan kesalahannya cenderung berupa perbedaan satu titik yang mengubah makna daripada omong kosong yang jelas.
- Tulisan tangan tidak didukung. Ini bukan kasus penggunaan yang didukung dalam bahasa apa pun, dan terutama untuk tulisan tangan Bahasa Arab.
OCR berjalan di perangkat Anda sendiri dan merupakan bagian dari CyvoDocOps Pro; karena Pro dibeli melalui App Store atau Google Play alih-alih di web, alat OCR berada di aplikasi seluler. Untuk latar belakang umum tentang cara kerja pengenalan, lihat cara membuat PDF hasil pindaian yang dapat dicari.
Stempel dan anotasi dalam dokumen RTL
Dokumen bisnis Arab sangat bergantung pada stempel dan segel, jauh lebih dari dokumen Barat — persetujuan, tanda terima, dukungan resmi. Menambahkan stempel ke PDF memiliki tantangan tersendiri: teks di dalam stempel memerlukan pembentukan yang benar, dan konvensi penempatan mengikuti arah baca, sehingga stempel yang terlihat alami pada halaman kiri-ke-kanan bisa terlihat janggal pada halaman kanan-ke-kiri.
Stempel Arab menangani pembentukan agar teks ditampilkan sebagai bahasa Arab yang menyambung, bukan barisan huruf terpisah — mode kegagalan yang Anda dapatkan dari alat yang memperlakukan bahasa Arab seolah-olah itu adalah Latin dengan karakter berbeda. Alat terkait seperti stempel tanggal dan inisial mengikuti pola yang sama.
Kebiasaan praktis untuk dokumen Arab
- Simpan sumbernya. Sumber asli dari perangkat lunak pembuatnya akan selalu memberikan teks yang lebih baik daripada apa pun yang dipulihkan kemudian.
- Uji ekstraksi sebelum Anda berkomitmen. Jika alur kerja bergantung pada pencarian PDF Arab, periksa apakah teks benar-benar keluar dari sampel sebelum membangunnya di sekitarnya.
- Utamakan teks asli daripada pindaian. PDF Arab yang dibuat secara digital jauh lebih baik daripada hasil pindaian. Pindai hanya jika kertas adalah satu-satunya sumber.
- Konten campuran berbagai bahasa (mixed content). Dokumen yang menggabungkan bahasa Arab dengan istilah Inggris, nomor faktur, dan tanggal adalah tempat masalah bidi terkonsentrasi. Periksa baris-baris tersebut secara spesifik.
- Jangan menilai dari penampilan luarnya. Sebuah berkas yang terlihat indah pun masih bisa berupa hasil pindaian (scan), atau membawa lapisan teks yang tidak dapat digunakan. Coba pilih sebuah kata — jika tidak ada yang disorot, berarti itu hanyalah gambar.
Mengapa pemrosesan lokal penting di sini
Dokumen berbahasa Arab yang membutuhkan jenis pekerjaan ini biasanya adalah dokumen resmi: kontrak, berkas pemerintah, pendaftaran komersial, dokumen identitas, catatan notaris. Itulah kategori tepat di mana mengunggah ke layanan pihak ketiga paling tidak sesuai — dan di mana "kami hapus setelah satu jam" adalah janji yang tidak dapat Anda audit. Di CyvoDocOps, operasi yang didukung berjalan secara lokal di peramban (browser) Anda, dan OCR on-device pada aplikasi seluler memproses hasil pindaian tanpa mengirimkannya ke mana pun. Lihat alat PDF bahasa Arab untuk mengetahui apa saja yang tersedia.
Pertanyaan yang sering diajukan
Mengapa teks Arab menjadi terputus saat saya menyalinnya dari PDF?
Karena PDF menyimpan glif pra-bentuk dan peta kembali ke karakter asli hilang atau salah. Halaman tersebut digambar dengan benar; informasi yang dibutuhkan untuk merekonstruksi teks aslinya telah dibuang saat file dibuat.
Mengapa teksnya terbalik saat saya tempelkan?
File tersebut menyimpan glif dalam urutan gambar tanpa informasi yang cukup untuk memulihkan urutan baca. Beberapa pembaca memperbaikinya dengan benar dan beberapa tidak — mencoba pembaca yang berbeda adalah solusi nyata.
Apakah OCR bahasa Arab akurat seperti Bahasa Inggris?
Tidak, dan siapa pun yang mengklaim sebaliknya sedang melebih-lebihkan. Huruf yang terhubung, bentuk yang bergantung pada posisi, dan titik pembawa makna semuanya membuatnya lebih sulit. Pemindaian cetak bersih memberikan hasil bagus yang tetap memerlukan pemeriksaan ulang.
Bisakah saya mencari di PDF pindaian bahasa Arab?
Tidak sampai ada lapisan teks. Jalankan OCR untuk menambahkannya — meskipun perlu diperhatikan bahwa hasil pencarian negatif dalam dokumen yang telah melalui OCR bukanlah bukti bahwa kata tersebut tidak ada.
Apakah dokumen bahasa Arab saya sudah diunggah?
Belum. Operasi web yang didukung berjalan secara lokal di peramban Anda, dan OCR di aplikasi seluler berjalan di perangkat Anda. Dokumen tersebut tidak dikirim ke server.