CyvoDocOps
Türkçe
Dark

Taranmış Bir PDF'i Aranabilir Hale Nasıl Getirilir

Kırk sayfalık eski sözleşmeleri tarıyor, bunları tek bir düzenli PDF olarak kaydediyor ve "tazminat" kelimesini arıyorsunuz. Ctrl+F hiçbir şey bulamıyor. Kelimeyi görebiliyorsunuz — tam on ikinci sayfada yer alıyor — ancak bilgisayarınız bulamıyor, çünkü onun bakış açısıyla o sayfa hiç kelime içermiyor. Bir fotoğraf içeriyor.

Görünüşte Aynı Olan Üç Tür PDF

Tarama ile ilgili neredeyse tüm kafa karışıklıkları buradan başlıyor. Ekranda aynı görünen üç çok farklı dosya olabilir:

Üçüncü tür ise istediğiniz şeydir ve OCR de sizi oraya ulaştırır.

Kısa versiyonu: bir tarama, metnin resmidir. OCR bu resmi okur ve kelimeleri yazar. Aranabilir bir PDF hem resmi korur hem de kelimeleri sessizce arkasına yerleştirir.

OCR'ın Gerçekte Ne Yaptığı

Optik Karakter Tanıma, piksellere bakar, karakter gibi görünen şekilleri bulur ve bu karakterlerin ne olduğuna karar verir. Modern motorlar harfleri birer birer şablon gibi eşleştirmek yerine; metin satırları boyunca çalışarak belirsizliği çözmek için ve çevredeki bağlamı kullanırlar. Bu bağlam, iyi bir motorun "modern" kelimesindeki "rn" harflerini iki harf olarak okumasının nedeni olabilir, ancak bozuk bir taramada bile zorlanabilir — her seferinde bilinçli bir tahmin yapıyordur.

Bu 'tahmin' kelimesi, OCR'ın dürüst özüdür. Bu, kayıpsız bir dönüştürme değil, bir görüntüye olasılıksal bir okumadır. Genellikle çok iyi bir tahmindir. Asla garantili değildir.

Neden Aranabilir Bir PDF Genellikle İstediğiniz Şeydir

Bir taramayı OCR ile okuyup sadece metni tutabilirsiniz, ancak belgeyi feda etmiş olursunuz: imza, antetli kağıt, kahve lekesi, düzen — onu bir transkript yerine orijinal yapan her şey. Ve OCR kusurlu olduğu için, saf metin sürümünün kendini kontrol etme yolu yoktur.

Aranabilir bir PDF bu takası yapmaktan kaçınır. Taranmış görüntü tam olarak kaldığı gibi, dokunulmamış haliyle kalır. Tanınan metin ise, karşılık geldiği kelimelerin üzerine yerleştirilmiş görünmez bir katman olarak eklenir. Orijinalini görürsünüz; bilgisayarınız metni görür; bir paragraf kopyaladığınızda kelimeleri alırsınız ve bir tanıma hatası sızdığında da gerçek sayfa karşılaştırma için hala oradadır.

Doğruluğu ne belirliyor

OCR kalitesi, motor çalışmadan çok önce — çoğunlukla tarama anında belirlenir:

Bir tarama kötü çıkarsa, en değerli çözüm neredeyse hiç zaman farklı bir OCR ayarı değiştirmek değildir. Bu yeniden taramaktır: daha düz, daha parlak, daha dik ve 300 dpi'de. Tarayıcıda geçen on saniye, çıktı üzerinde bir saat harcamaktan iyidir.

Araması Yapılabilen PDF mi yoksa Düz Metin mi?

İki farklı hedef, iki farklı araç ve yanlışını seçmek zaman kaybıdır:

Emin değilseniz, aranabilir PDF'yi seçin. Daha sonra içinden metin çekebilirsiniz; attığınız bir sayfayı geri alamazsınız.

Nasıl Yapılır

CyvoDocOps'taki OCR, kendi cihazınızda çalışır — tarama asla bir sunucuya yüklenmez. Bu CyvoDocOps Pro'nun bir parçasıdır ve Pro, web üzerinden değil App Store veya Google Play aracılığıyla satın alındığı için, OCR araçları mobil uygulamada bulunur.

  1. Yapabileceğiniz en iyi taramayı alın. 300 dpi, düz, iyi ışık, düz bir yüzey. Bu adım, sonucunuzu başka hiçbir adımdan daha çok belirler.
  2. Belgeyi CyvoDocOps uygulamasında açın. Uygulamanız yoksa uygulamayı görebilirsiniz.
  3. Aracınızı seçin. Sayfayı korumak ve gizli katman eklemek için Arama Yapılabilir PDF; kelimeleri çıkarmak için Metin Çıkar; okuduğunuz dil için ise OCR İngilizce veya OCR Arapça kullanın.
  4. Sonucu kontrol edin. Birinci sayfada olduğundan emin olduğunuz bir kelime arayın. Bulunmuyorsa, tanıma zorlanmış demektir — bu genellikle taramaya işaret eder.

CyvoDocOps uygulamasını indirin

Sınırlamalar hakkında dürüst olmak gerekirse

Arapça ve diğer alfabeler

Tanıma zorluğu, yazı tipine göre muazzam farklılıklar gösterir. Arapça, İngilizce'den belirgin şekilde daha zordur: harfler birleşir, şekilleri kelime içindeki konumuna göre değişir, diakritikler anlam taşır ve metin sağdan sola doğru akar. İngilizce için eğitilmiş bir model bu konuda işe yaramaz — Arapça OCR aracılığıyla Arapça modele ihtiyacınız var. Eğer kullanım senaryonuz buysa, Arapça PDF'lerle çalışma spesifik detayları ele almaktadır.

Bu bağlamda cihaz üzerinde çalışmanın önemi

İnsanların gerçekten ne taradığını düşünün: sözleşmeler, tıbbi mektuplar, banka hesap özetleri, pasaportlar, vergi kayıtları. Tarama, kağıt üzerinde var olan ve önemli olduğu için belgeler üzerinde yaptığınız bir işlemdir. Bu yığını başka birinin sunucusuna işlenmesi için göndermek tuhaf bir pazarlıktır — ve yaygın bir durumdur, çünkü çoğu OCR hizmetinin başka yolu yoktur. Tanımayı kendi cihazınızda çalıştırmak, belgenin başladığı yerde kalmasını sağlar. Hiçbir şey yüklenmez, bu yüzden saklanacak, günlük tutulacak veya sızdırılacak hiçbir şey yoktur.

Sıkça Sorulan Sorular

Taranmış PDF'imi neden arayamıyorum?

Metin içermediği için. Her sayfa bir resimdir ve arama karakterler arar. OCR, resmi bilgisayarınızın bulabileceği kelimelere dönüştüren şeydir.

Bir PDF'yi aranabilir yapmak görünüşünü değiştirir mi?

Hayır. Taranan görüntü tam olarak korunur. Tanınan metin, onun arkasına görünmez bir katman olarak eklenir.

OCR el yazısı üzerinde çalışacak mı?

Hayır. Motor, makine basımı metinler için tasarlanmıştır. El yazısı farklı bir problemdir ve desteklenen bir kullanım durumu değildir.

OCR neden tarayıcıda değil de uygulamada?

Bu, CyvoDocOps Pro'nun bir parçasıdır ve Pro, App Store veya Google Play üzerinden satın alınır — web ödeme seçeneği yoktur — bu nedenle araçlar uygulamada bulunur. Tanıma her iki durumda da cihazınızda çalışır.

Taramam OCR için yükleniyor mu?

Tanıma tamamen cihazınızda çalışır ve belge bir sunucuya gönderilmez.

İlgili kılavuzlar ve araçlar