CyvoDocOps
Bahasa Indonesia
Dark

Cara membuat PDF hasil pindaian menjadi dapat dicari

Anda memindai empat puluh halaman kontrak lama, menyimpannya sebagai satu file PDF yang rapi, dan mencari kata "ganti rugi". Ctrl+F tidak menemukan apa-apa. Anda bisa melihat kata itu — memang ada di halaman dua belas — tetapi komputer Anda tidak bisa, karena bagi komputer itu halaman tersebut sama sekali tidak berisi kata-kata. Itu hanyalah sebuah foto.

Tiga jenis PDF yang terlihat identik

Hampir semua kebingungan tentang hasil pindaian dimulai dari sini. Tiga file yang sangat berbeda dapat tampak sama di layar:

Jenis ketiga adalah yang Anda inginkan, dan OCR adalah cara untuk mencapainya.

Versi singkatnya: pemindaian adalah gambar teks. OCR membaca gambar tersebut dan menuliskan kata-kata di dalamnya. PDF yang dapat dicari menyimpan gambarnya dan secara diam-diam menyematkan kata-kata di belakangnya.

Apa sebenarnya yang dilakukan OCR

Pengenalan Karakter Optik (Optical Character Recognition) melihat piksel, menemukan bentuk-bentuk yang menyerupai karakter, dan menentukan karakter apa itu. Mesin modern tidak mencocokkan huruf satu per satu seperti stensil; mereka bekerja sepanjang baris teks, menggunakan bentuk dan konteks di sekitarnya untuk menyelesaikan ambiguitas. Konteks itulah mengapa mesin yang bagus membaca "rn" sebagai dua huruf dalam kata "modern" tetapi mungkin masih tersandung saat melihatnya pada hasil pindaian yang buram — itu membuat tebakan terinformasi, setiap saat.

Kata tersebut — tebakan — adalah inti jujur dari OCR. Ini adalah pembacaan probabilistik dari sebuah gambar, bukan konversi tanpa kehilangan data. Biasanya merupakan tebakan yang sangat bagus. Tidak pernah jaminan.

Mengapa PDF yang dapat dicari biasanya yang Anda inginkan

Anda bisa melakukan OCR pada hasil pindaian dan hanya menyimpan teksnya, tetapi Anda akan membuang dokumen: tanda tangan, kop surat, noda kopi, tata letak — semua yang menjadikannya asli alih-alih transkrip. Dan karena OCR tidak sempurna, versi teks murni tidak memiliki cara untuk memeriksa dirinya sendiri.

PDF yang dapat dicari menghindari pertukaran itu. Gambar hasil pindaian tetap persis seperti semula, tidak tersentuh. Teks yang dikenali ditambahkan sebagai lapisan tak terlihat yang diposisikan di atas kata-kata yang sesuai dengannya. Anda melihat aslinya; komputer Anda melihat teksnya; ketika Anda menyalin sebuah paragraf Anda mendapatkan kata-katanya, dan ketika kesalahan pengenalan muncul halaman asli masih ada di sana untuk dibandingkan.

Apa yang benar-benar menentukan akurasi

Kualitas OCR ditentukan jauh sebelum mesin dijalankan — sebagian besar pada saat pemindaian:

Jika hasil pindaian buruk, perbaikan bernilai tertinggi hampir tidak pernah adalah pengaturan OCR yang berbeda. Ini adalah memindai ulang: lebih datar, lebih terang, lebih lurus, pada 300 dpi. Sepuluh detik dengan pemindai lebih baik daripada satu jam mengoreksi hasilnya.

PDF yang Dapat Dicari atau Teks Biasa?

Dua tujuan berbeda, dua alat berbeda, dan memilih yang salah akan membuang waktu:

Jika Anda tidak yakin, pilih PDF yang dapat dicari. Anda selalu bisa menarik teks darinya nanti; Anda tidak bisa memulihkan halaman yang telah Anda buang.

Cara Melakukannya

OCR di CyvoDocOps berjalan pada perangkat Anda sendiri — pindaian tidak pernah diunggah ke server. Ini adalah bagian dari CyvoDocOps Pro, dan karena Pro dibeli melalui App Store atau Google Play daripada di web, alat OCR berada di aplikasi seluler.

  1. Dapatkan hasil pindaian terbaik yang Anda bisa. 300 dpi, datar, pencahayaan bagus, lurus. Langkah ini menentukan hasil Anda lebih dari langkah lainnya.
  2. Buka dokumen di aplikasi CyvoDocOps. Lihat aplikasi jika Anda belum memilikinya.
  3. Pilih alat Anda. Gunakan PDF yang dapat dicari untuk mempertahankan halaman dan menambahkan lapisan tersembunyi; Ekstrak Teks untuk menarik kata-kata di dalamnya; atau OCR Bahasa Inggris atau OCR Bahasa Arab sesuai bahasa yang Anda baca.
  4. Periksa hasilnya. Cari kata yang Anda tahu ada di halaman satu. Jika tidak ditemukan, berarti pengenalan mengalami kesulitan — yang biasanya kembali menunjuk pada hasil pindaian itu sendiri.

Dapatkan aplikasi CyvoDocOps

Transparan mengenai keterbatasan

Bahasa Arab, dan skrip lainnya

Tingkat kesulitan pengenalan sangat bervariasi tergantung skripnya. Bahasa Arab jauh lebih sulit daripada bahasa Inggris: huruf-huruf menyambung, bentuknya berubah berdasarkan posisi dalam kata, diakritik membawa makna, dan teks berjalan dari kanan ke kiri. Model yang dilatih untuk bahasa Inggris tidak berguna untuk itu — Anda memerlukan model Bahasa Arab, melalui OCR Bahasa Arab. Jika itu kasus penggunaan Anda, bekerja dengan PDF berbahasa Arab mencakup rinciannya.

Mengapa operasi di perangkat (on-device) penting di sini

Pikirkan tentang apa yang sebenarnya dipindai orang: kontrak, surat medis, laporan bank, paspor, catatan pajak. Pemindaian adalah hal yang Anda lakukan pada dokumen yang ada di atas kertas karena dokumen itu penting. Mengirim tumpukan itu ke server orang lain untuk diproses adalah kesepakatan aneh — dan umum terjadi, karena sebagian besar layanan OCR tidak punya cara kerja lain. Menjalankan pengenalan di perangkat Anda sendiri menjaga dokumen tetap berada di tempat asalnya. Tidak ada yang diunggah, jadi tidak ada yang perlu disimpan, dicatat, atau bocor.

Pertanyaan yang sering diajukan

Mengapa saya tidak bisa mencari PDF hasil pindaian saya?

Karena tidak mengandung teks. Setiap halaman adalah gambar, dan pencarian mencari karakter. OCR adalah proses yang mengubah gambar menjadi kata-kata yang dapat ditemukan oleh komputer Anda.

Apakah membuat PDF dapat dicari akan mengubah tampilannya?

Tidak. Gambar hasil pindaian dipertahankan persis seperti aslinya. Teks yang dikenali ditambahkan sebagai lapisan tak terlihat di belakangnya.

Apakah OCR akan berfungsi pada tulisan tangan?

Tidak. Mesin ini dirancang untuk teks cetak mesin. Tulisan tangan adalah masalah yang berbeda dan bukan kasus penggunaan yang didukung.

Mengapa OCR ada di aplikasi, bukan di peramban (browser)?

Ini adalah bagian dari CyvoDocOps Pro, dan Pro dibeli melalui App Store atau Google Play — tidak ada pembayaran web — jadi alat-alat tersebut berada di dalam aplikasi. Pengenalan berjalan pada perangkat Anda bagaimanapun juga.

Apakah hasil pindaian saya diunggah untuk OCR?

Nomor. Pengenalan berjalan sepenuhnya di perangkat Anda dan dokumen tidak dikirim ke server.

Panduan & alat terkait