Taranmış Bir PDF'i Aranabilir Hale Nasıl Getirilir
Kırk sayfalık eski sözleşmeleri tarıyor, bunları tek bir düzenli PDF olarak kaydediyor ve "tazminat" kelimesini arıyorsunuz. Ctrl+F hiçbir şey bulamıyor. Kelimeyi görebiliyorsunuz — tam on ikinci sayfada yer alıyor — ancak bilgisayarınız bulamıyor, çünkü onun bakış açısıyla o sayfa hiç kelime içermiyor. Bir fotoğraf içeriyor.
Görünüşte Aynı Olan Üç Tür PDF
Tarama ile ilgili neredeyse tüm kafa karışıklıkları buradan başlıyor. Ekranda aynı görünen üç çok farklı dosya olabilir:
- Doğrudan Dijital PDF. Bir kelime işlemciden dışa aktarılmış. Gerçek karakterleri ve gerçek yazı tiplerini depolar. Metin gerçekten metin olduğu için arama, seçme ve kopyalama işlemleri hepsi çalışır.
- Sadece Görsel PDF. Bir tarayıcıdan veya telefon kamerasından alınmış. Her sayfa büyük bir resimdir. Dosyada metin yoktur — sadece metin gibi görünmesi için düzenlenmiş pikseller vardır. Bu, Ctrl+F'yi devre dışı bırakan şey budur.
- Aranabilir PDF. Tarama artı görünmez bir metin katmanı. Görselden tamamen aynı görünüyor — aynı resim, aynı sayfa — ancak metin onun arkasında yer aldığı için arama ve kopyalama çalışır.
Üçüncü tür ise istediğiniz şeydir ve OCR de sizi oraya ulaştırır.
OCR'ın Gerçekte Ne Yaptığı
Optik Karakter Tanıma, piksellere bakar, karakter gibi görünen şekilleri bulur ve bu karakterlerin ne olduğuna karar verir. Modern motorlar harfleri birer birer şablon gibi eşleştirmek yerine; metin satırları boyunca çalışarak belirsizliği çözmek için ve çevredeki bağlamı kullanırlar. Bu bağlam, iyi bir motorun "modern" kelimesindeki "rn" harflerini iki harf olarak okumasının nedeni olabilir, ancak bozuk bir taramada bile zorlanabilir — her seferinde bilinçli bir tahmin yapıyordur.
Bu 'tahmin' kelimesi, OCR'ın dürüst özüdür. Bu, kayıpsız bir dönüştürme değil, bir görüntüye olasılıksal bir okumadır. Genellikle çok iyi bir tahmindir. Asla garantili değildir.
Neden Aranabilir Bir PDF Genellikle İstediğiniz Şeydir
Bir taramayı OCR ile okuyup sadece metni tutabilirsiniz, ancak belgeyi feda etmiş olursunuz: imza, antetli kağıt, kahve lekesi, düzen — onu bir transkript yerine orijinal yapan her şey. Ve OCR kusurlu olduğu için, saf metin sürümünün kendini kontrol etme yolu yoktur.
Aranabilir bir PDF bu takası yapmaktan kaçınır. Taranmış görüntü tam olarak kaldığı gibi, dokunulmamış haliyle kalır. Tanınan metin ise, karşılık geldiği kelimelerin üzerine yerleştirilmiş görünmez bir katman olarak eklenir. Orijinalini görürsünüz; bilgisayarınız metni görür; bir paragraf kopyaladığınızda kelimeleri alırsınız ve bir tanıma hatası sızdığında da gerçek sayfa karşılaştırma için hala oradadır.
Doğruluğu ne belirliyor
OCR kalitesi, motor çalışmadan çok önce — çoğunlukla tarama anında belirlenir:
- Çözünürlük. Basılı metin için yaklaşık 300 dpi idealdir. Yaklaşık 200'nin altında karakterler ayırt etmek için gereken ayrıntıyı kaybeder. 400'ün üzerinde ise okumayı daha iyi yapmaktan çok dosyayı büyütmüş olursunuz.
- Kontrast. Temiz beyaz zemin üzerine keskin siyah idealdir. Gri fotokopiler, renkli kağıtlar ve sayfadaki gölgeler tüm doğruluğunuzdan ödün verir.
- Düzlük. Eğrilik gerçek bir düşmandır. Açılı çekilmiş veya kitap omurgasına yakın eğimli bir sayfa, motora takip etmesi gereken bükülmüş temel çizgiler verir.
- Baskı kalitesi. Temiz makine baskısı iyi okunur. Fakslar, üçüncü nesil fotokopiler, nokta matris çıktılar ve damgalanmış metinler çok daha kötü okunur.
- Doğru dil. Motor, belirsizliği çözmek için bir dil modeli kullanır. İngilizce bir modelin Fransızca bir belge üzerinde çalıştırılması, alfabe eşleşse bile sonuçları düşürür.
- El yazısı — hayır. Bu motor makine basımı metinler için oluşturulmuştur. El yazısı tanıma tamamen farklı bir problemdir ve desteklenen bir kullanım durumu değildir. Belgeniz el yazısıyla yazılmışsa, OCR çelişkili saçmalıklar üretecektir.
Bir tarama kötü çıkarsa, en değerli çözüm neredeyse hiç zaman farklı bir OCR ayarı değiştirmek değildir. Bu yeniden taramaktır: daha düz, daha parlak, daha dik ve 300 dpi'de. Tarayıcıda geçen on saniye, çıktı üzerinde bir saat harcamaktan iyidir.
Araması Yapılabilen PDF mi yoksa Düz Metin mi?
İki farklı hedef, iki farklı araç ve yanlışını seçmek zaman kaybıdır:
- Belgenin bir belge olarak kalmasını istiyorsunuz — aranabilir, kopyalanabilir, arşivlenebilir, hala orijinal gibi görünmesi. Bu Aranabilir PDF'dir (Searchable PDF). Sözleşmeler, kayıtlar, daha sonra orijinal haliyle üretmeniz gerekebilecek her şey için en iyisidir.
- Kelimeleri çıkarmak istiyorsunuz — bir e-postaya yapıştırmak, bir elektronik tabloya beslemek, bir raporda alıntı yapmak. Bu ise düz metin veren ve düzeni yok eden Metni Çıkarma (Extract Text) özelliğidir.
Emin değilseniz, aranabilir PDF'yi seçin. Daha sonra içinden metin çekebilirsiniz; attığınız bir sayfayı geri alamazsınız.
Nasıl Yapılır
CyvoDocOps'taki OCR, kendi cihazınızda çalışır — tarama asla bir sunucuya yüklenmez. Bu CyvoDocOps Pro'nun bir parçasıdır ve Pro, web üzerinden değil App Store veya Google Play aracılığıyla satın alındığı için, OCR araçları mobil uygulamada bulunur.
- Yapabileceğiniz en iyi taramayı alın. 300 dpi, düz, iyi ışık, düz bir yüzey. Bu adım, sonucunuzu başka hiçbir adımdan daha çok belirler.
- Belgeyi CyvoDocOps uygulamasında açın. Uygulamanız yoksa uygulamayı görebilirsiniz.
- Aracınızı seçin. Sayfayı korumak ve gizli katman eklemek için Arama Yapılabilir PDF; kelimeleri çıkarmak için Metin Çıkar; okuduğunuz dil için ise OCR İngilizce veya OCR Arapça kullanın.
- Sonucu kontrol edin. Birinci sayfada olduğundan emin olduğunuz bir kelime arayın. Bulunmuyorsa, tanıma zorlanmış demektir — bu genellikle taramaya işaret eder.
CyvoDocOps uygulamasını indirin
Sınırlamalar hakkında dürüst olmak gerekirse
- OCR asla %100 doğru değildir. Temiz taramalarda bile hatalar olabilir — yanlış okunan bir rakam, kaybolan bir tire. İyi olmak mükemmel demek değildir ve sayı bir ödeme tutarı olduğunda bu fark önemlidir.
- Negatif aramaya güvenmeyin. Ctrl+F ile "indemnity" (tazminat) bulunamazsa, bunun kelimenin orada olmadığı veya OCR'ın onu "indernnity" olarak okuduğu anlamına gelebilir. Bir OCR'lanmış belgede bir eşleşmenin olmaması, yokluğunun kanıtı değildir — yasal veya tıbbi amaçlar için kayıt arıyorsanız önemli bir ayrımdır.
- Tablolar ve sütunlar zordur. Tanıma, metin satırlarını takip eder; karmaşık düzenler, her bir karakter doğru okunsa bile sütunları iç içe geçirebilir veya tablo hücrelerini karıştırabilir.
- Metin katmanı yanlış olabilirken sayfa doğru görünebilir. Bu, tasarımın amaçlandığı şekilde çalışmasıdır — görüntü kayıttır, metin ise indekstir — ancak sadece katmana bakarak alıntı yapmayın, sayfaya da bakın.
Arapça ve diğer alfabeler
Tanıma zorluğu, yazı tipine göre muazzam farklılıklar gösterir. Arapça, İngilizce'den belirgin şekilde daha zordur: harfler birleşir, şekilleri kelime içindeki konumuna göre değişir, diakritikler anlam taşır ve metin sağdan sola doğru akar. İngilizce için eğitilmiş bir model bu konuda işe yaramaz — Arapça OCR aracılığıyla Arapça modele ihtiyacınız var. Eğer kullanım senaryonuz buysa, Arapça PDF'lerle çalışma spesifik detayları ele almaktadır.
Bu bağlamda cihaz üzerinde çalışmanın önemi
İnsanların gerçekten ne taradığını düşünün: sözleşmeler, tıbbi mektuplar, banka hesap özetleri, pasaportlar, vergi kayıtları. Tarama, kağıt üzerinde var olan ve önemli olduğu için belgeler üzerinde yaptığınız bir işlemdir. Bu yığını başka birinin sunucusuna işlenmesi için göndermek tuhaf bir pazarlıktır — ve yaygın bir durumdur, çünkü çoğu OCR hizmetinin başka yolu yoktur. Tanımayı kendi cihazınızda çalıştırmak, belgenin başladığı yerde kalmasını sağlar. Hiçbir şey yüklenmez, bu yüzden saklanacak, günlük tutulacak veya sızdırılacak hiçbir şey yoktur.
Sıkça Sorulan Sorular
Taranmış PDF'imi neden arayamıyorum?
Metin içermediği için. Her sayfa bir resimdir ve arama karakterler arar. OCR, resmi bilgisayarınızın bulabileceği kelimelere dönüştüren şeydir.
Bir PDF'yi aranabilir yapmak görünüşünü değiştirir mi?
Hayır. Taranan görüntü tam olarak korunur. Tanınan metin, onun arkasına görünmez bir katman olarak eklenir.
OCR el yazısı üzerinde çalışacak mı?
Hayır. Motor, makine basımı metinler için tasarlanmıştır. El yazısı farklı bir problemdir ve desteklenen bir kullanım durumu değildir.
OCR neden tarayıcıda değil de uygulamada?
Bu, CyvoDocOps Pro'nun bir parçasıdır ve Pro, App Store veya Google Play üzerinden satın alınır — web ödeme seçeneği yoktur — bu nedenle araçlar uygulamada bulunur. Tanıma her iki durumda da cihazınızda çalışır.
Taramam OCR için yükleniyor mu?
Tanıma tamamen cihazınızda çalışır ve belge bir sunucuya gönderilmez.