Cara membuat PDF hasil pindaian menjadi dapat dicari
Anda memindai empat puluh halaman kontrak lama, menyimpannya sebagai satu file PDF yang rapi, dan mencari kata "ganti rugi". Ctrl+F tidak menemukan apa-apa. Anda bisa melihat kata itu — memang ada di halaman dua belas — tetapi komputer Anda tidak bisa, karena bagi komputer itu halaman tersebut sama sekali tidak berisi kata-kata. Itu hanyalah sebuah foto.
Tiga jenis PDF yang terlihat identik
Hampir semua kebingungan tentang hasil pindaian dimulai dari sini. Tiga file yang sangat berbeda dapat tampak sama di layar:
- PDF asli digital (born-digital). Diekspor dari pengolah kata. File ini menyimpan karakter aktual dengan font aktual. Pencarian, seleksi, dan salin semuanya berfungsi karena teksnya benar-benar berupa teks.
- PDF hanya gambar (image-only). Berasal dari pemindai atau kamera ponsel. Setiap halaman adalah satu gambar besar. Tidak ada teks di dalam file — hanya piksel yang disusun agar terlihat seperti teks. Inilah yang membuat Ctrl+F gagal berfungsi.
- PDF yang dapat dicari (searchable). Hasil pindaian ditambah lapisan teks tak terlihat. File ini terlihat persis seperti versi hanya gambar — foto dan halamannya sama — tetapi teks berada di belakangnya, sehingga pencarian dan penyalinan berfungsi.
Jenis ketiga adalah yang Anda inginkan, dan OCR adalah cara untuk mencapainya.
Apa sebenarnya yang dilakukan OCR
Pengenalan Karakter Optik (Optical Character Recognition) melihat piksel, menemukan bentuk-bentuk yang menyerupai karakter, dan menentukan karakter apa itu. Mesin modern tidak mencocokkan huruf satu per satu seperti stensil; mereka bekerja sepanjang baris teks, menggunakan bentuk dan konteks di sekitarnya untuk menyelesaikan ambiguitas. Konteks itulah mengapa mesin yang bagus membaca "rn" sebagai dua huruf dalam kata "modern" tetapi mungkin masih tersandung saat melihatnya pada hasil pindaian yang buram — itu membuat tebakan terinformasi, setiap saat.
Kata tersebut — tebakan — adalah inti jujur dari OCR. Ini adalah pembacaan probabilistik dari sebuah gambar, bukan konversi tanpa kehilangan data. Biasanya merupakan tebakan yang sangat bagus. Tidak pernah jaminan.
Mengapa PDF yang dapat dicari biasanya yang Anda inginkan
Anda bisa melakukan OCR pada hasil pindaian dan hanya menyimpan teksnya, tetapi Anda akan membuang dokumen: tanda tangan, kop surat, noda kopi, tata letak — semua yang menjadikannya asli alih-alih transkrip. Dan karena OCR tidak sempurna, versi teks murni tidak memiliki cara untuk memeriksa dirinya sendiri.
PDF yang dapat dicari menghindari pertukaran itu. Gambar hasil pindaian tetap persis seperti semula, tidak tersentuh. Teks yang dikenali ditambahkan sebagai lapisan tak terlihat yang diposisikan di atas kata-kata yang sesuai dengannya. Anda melihat aslinya; komputer Anda melihat teksnya; ketika Anda menyalin sebuah paragraf Anda mendapatkan kata-katanya, dan ketika kesalahan pengenalan muncul halaman asli masih ada di sana untuk dibandingkan.
Apa yang benar-benar menentukan akurasi
Kualitas OCR ditentukan jauh sebelum mesin dijalankan — sebagian besar pada saat pemindaian:
- Resolusi. Sekitar 300 dpi adalah titik ideal untuk teks cetak. Di bawah sekitar 200, karakter kehilangan detail yang diperlukan untuk membedakannya. Di atas 400 Anda sebagian besar hanya membuat file lebih besar, bukan pembacaan yang lebih baik.
- Kontras. Hitam pekat di latar putih bersih adalah ideal. Fotokopi abu-abu, kertas berwarna, dan bayangan di seluruh halaman semuanya mengurangi akurasi Anda.
- Kerapatan/Kelurusan. Kemiringan (skew) adalah musuh nyata. Halaman yang difoto pada sudut, atau dengan lengkungan buku di dekat tulang punggungnya, memberikan mesin garis dasar bengkok untuk diikuti.
- Kualitas cetak. Cetakan mesin yang bersih terbaca dengan baik. Faksimili, fotokopi generasi ketiga, output dot-matrix, dan teks stempel terbaca jauh lebih buruk.
- Bahasa yang tepat. Mesin menggunakan model bahasa untuk menyelesaikan ambiguitas. Menjalankan model Bahasa Inggris pada dokumen Prancis akan menurunkan hasil meskipun alfabetnya cocok.
- Tulisan tangan — jangan. Mesin ini dibangun untuk teks cetak mesin. Pengenalan tulisan tangan adalah masalah yang benar-benar berbeda dan bukan kasus penggunaan yang didukung. Jika dokumen Anda ditulis tangan, OCR akan menghasilkan omong kosong yang percaya diri.
Jika hasil pindaian buruk, perbaikan bernilai tertinggi hampir tidak pernah adalah pengaturan OCR yang berbeda. Ini adalah memindai ulang: lebih datar, lebih terang, lebih lurus, pada 300 dpi. Sepuluh detik dengan pemindai lebih baik daripada satu jam mengoreksi hasilnya.
PDF yang Dapat Dicari atau Teks Biasa?
Dua tujuan berbeda, dua alat berbeda, dan memilih yang salah akan membuang waktu:
- Anda ingin dokumen tetap berupa dokumen — dapat dicari, dapat disalin, diarsipkan, masih terlihat seperti aslinya. Itu adalah PDF yang Dapat Dicari. Terbaik untuk kontrak, catatan, apa pun yang mungkin perlu Anda hasilkan nanti sebagaimana adanya.
- Anda ingin kata-katanya keluar — untuk ditempel ke email, dimasukkan ke spreadsheet, dikutip dalam laporan. Itu adalah Ekstrak Teks, yang memberi Anda teks biasa dan membuang tata letak.
Jika Anda tidak yakin, pilih PDF yang dapat dicari. Anda selalu bisa menarik teks darinya nanti; Anda tidak bisa memulihkan halaman yang telah Anda buang.
Cara Melakukannya
OCR di CyvoDocOps berjalan pada perangkat Anda sendiri — pindaian tidak pernah diunggah ke server. Ini adalah bagian dari CyvoDocOps Pro, dan karena Pro dibeli melalui App Store atau Google Play daripada di web, alat OCR berada di aplikasi seluler.
- Dapatkan hasil pindaian terbaik yang Anda bisa. 300 dpi, datar, pencahayaan bagus, lurus. Langkah ini menentukan hasil Anda lebih dari langkah lainnya.
- Buka dokumen di aplikasi CyvoDocOps. Lihat aplikasi jika Anda belum memilikinya.
- Pilih alat Anda. Gunakan PDF yang dapat dicari untuk mempertahankan halaman dan menambahkan lapisan tersembunyi; Ekstrak Teks untuk menarik kata-kata di dalamnya; atau OCR Bahasa Inggris atau OCR Bahasa Arab sesuai bahasa yang Anda baca.
- Periksa hasilnya. Cari kata yang Anda tahu ada di halaman satu. Jika tidak ditemukan, berarti pengenalan mengalami kesulitan — yang biasanya kembali menunjuk pada hasil pindaian itu sendiri.
Transparan mengenai keterbatasan
- OCR tidak pernah 100% akurat. Bahkan pada pindaian yang bersih pun ada kesalahan — angka salah baca, tanda hubung hilang. Bagus tidak berarti sempurna, dan kesenjangan itu penting ketika angkanya adalah jumlah pembayaran.
- Jangan percaya pada pencarian negatif. Jika Ctrl+F tidak menemukan "indemnity", itu mungkin berarti kata tersebut memang tidak ada, atau bahwa OCR membacanya sebagai "indernnity". Tidak adanya hasil hit bukan bukti ketiadaan dalam dokumen yang telah di-OCR — ini adalah perbedaan penting jika Anda mencari catatan untuk keperluan hukum atau medis.
- Tabel dan kolom sulit. Pengenalan mengikuti baris teks; tata letak yang kompleks dapat menyelingi kolom atau mengacak sel tabel bahkan ketika setiap karakter individu dibaca dengan benar.
- Lapisan teks bisa salah padahal halamannya benar. Itu adalah desain yang bekerja sesuai rencana — gambar adalah rekamannya, dan teksnya adalah indeksnya — tetapi jangan mengutip dari lapisan tanpa melihat halaman aslinya.
Bahasa Arab, dan skrip lainnya
Tingkat kesulitan pengenalan sangat bervariasi tergantung skripnya. Bahasa Arab jauh lebih sulit daripada bahasa Inggris: huruf-huruf menyambung, bentuknya berubah berdasarkan posisi dalam kata, diakritik membawa makna, dan teks berjalan dari kanan ke kiri. Model yang dilatih untuk bahasa Inggris tidak berguna untuk itu — Anda memerlukan model Bahasa Arab, melalui OCR Bahasa Arab. Jika itu kasus penggunaan Anda, bekerja dengan PDF berbahasa Arab mencakup rinciannya.
Mengapa operasi di perangkat (on-device) penting di sini
Pikirkan tentang apa yang sebenarnya dipindai orang: kontrak, surat medis, laporan bank, paspor, catatan pajak. Pemindaian adalah hal yang Anda lakukan pada dokumen yang ada di atas kertas karena dokumen itu penting. Mengirim tumpukan itu ke server orang lain untuk diproses adalah kesepakatan aneh — dan umum terjadi, karena sebagian besar layanan OCR tidak punya cara kerja lain. Menjalankan pengenalan di perangkat Anda sendiri menjaga dokumen tetap berada di tempat asalnya. Tidak ada yang diunggah, jadi tidak ada yang perlu disimpan, dicatat, atau bocor.
Pertanyaan yang sering diajukan
Mengapa saya tidak bisa mencari PDF hasil pindaian saya?
Karena tidak mengandung teks. Setiap halaman adalah gambar, dan pencarian mencari karakter. OCR adalah proses yang mengubah gambar menjadi kata-kata yang dapat ditemukan oleh komputer Anda.
Apakah membuat PDF dapat dicari akan mengubah tampilannya?
Tidak. Gambar hasil pindaian dipertahankan persis seperti aslinya. Teks yang dikenali ditambahkan sebagai lapisan tak terlihat di belakangnya.
Apakah OCR akan berfungsi pada tulisan tangan?
Tidak. Mesin ini dirancang untuk teks cetak mesin. Tulisan tangan adalah masalah yang berbeda dan bukan kasus penggunaan yang didukung.
Mengapa OCR ada di aplikasi, bukan di peramban (browser)?
Ini adalah bagian dari CyvoDocOps Pro, dan Pro dibeli melalui App Store atau Google Play — tidak ada pembayaran web — jadi alat-alat tersebut berada di dalam aplikasi. Pengenalan berjalan pada perangkat Anda bagaimanapun juga.
Apakah hasil pindaian saya diunggah untuk OCR?
Nomor. Pengenalan berjalan sepenuhnya di perangkat Anda dan dokumen tidak dikirim ke server.