Arapça PDF'lerle Çalışma
Bir Arapça sözleşme açıyorsunuz, bir paragraf seçiyor, kopyalıyor ve bir e-postaya yapıştırıyorsunuz. Ortaya çıkan şey kopuk harflerden oluşan bir satır oluyor — ya da doğru harfler yanlış sırada, ya da neredeyse doğru görünen ama öyle olmayan bir karakter dizisi. PDF mükemmel görünüyor. Metni çıkarmaya çalıştığınız anda dağılıyor. Bu sizin yazılımınızın bozuk olduğu anlamına gelmiyor. Bu, gerçekten zor bir problemin ortaya çıkmasıdır.
Arapça'nın Latin alfabesinden daha zor olmasının nedeni
İngilizce bir metin sistemi çok az şey ister: harfler soldan sağa, tek sıra halinde yerleşir ve her yerde aynı şekle sahiptir. Arapça ise çok daha fazlasını gerektirir ve bu özelliklerin her biri araçların yanlış yapabileceği bir noktadır:
- Doğası gereği el yazısıdır (cursive). Harfler birbirine bağlanır. Bu dekoratif değil — yazı bu şekilde çalışır.
- Harfler konumuna göre şekil değiştirir. Tek bir harf, dört farklı biçime sahip olabilir: tek başına dururken, kelimenin başında, ortasında ve sonunda. Aynı harf, aynı anlam, dört farklı resim.
- Sağdan sola doğru akar — ama her şey öyle yapmaz. Sayılar ve gömülü Latin kelimeleri sağdan sola doğru metin içinde soldan sağa akar içinde.
- Diyakritikler isteğe bağlı ve anlamlıdır. Kısa ünlü işaretleri bulunabilir veya bulunmayabilir ve okumayı değiştirir.
Bu nedenle Arapçayı doğru bir şekilde görüntülemek, işleyicinin her harf için komşularına göre doğru şekli seçmesini ve ardından karışık yönlü dizileri tutarlı bir şekilde yerleştirmesini gerektirir. Sorun bu iki adımda ortaya çıkıyor.
Şekillendirme ve Kopyala-Yapıştır Neden Bozulur
İşte mekanizma, çünkü bunu bilmek karşılaşacağınız her semptomu açıklar.
Metin, mantıksal sırayla — söyleyeceğiniz sıra ile — depolanır. Çizilmeden önce yazılım şekillendirme uygular: her harf için doğru konumlandırma formunu seçmek ve ayrıca bidi (iki yönlü algoritma), bu da sağdan sola ve soldan sağa dizilerin satır üzerinde nasıl iç içe geçtiğini hesaplar.
Ancak bir PDF, cümlenizi depolamaz. Glifleri — bir yazı tipindeki indeksleri — artı konumları depolar. Şekillendirme zaten gerçekleşmiş ve içine gömülmüştür. Metni tekrar kopyalamak için okuyucunun gliften karaktere bir haritaya ihtiyacı vardır; bu da dosya tarafından ToUnicode tablosu olarak dahil edilebilir. Ve işte püf noktası:
- Harita yoksa, metin de yok demektir. Oluşturucu bir tane eklemediyse, çıkarma işlemi harfler yerine glif numaraları verir. İyi görüntülenen ama hiçbir anlam ifade etmeyen çöp verisi alırsınız.
- Yanlış bir şeye işaret eden harita. Bazı üreteçler glifleri şu biçimlere eşleştirir: sunum formları — her önceden şekillendirilmiş varyantı ayrı ayrı tutan eski bir Unicode bloğu. Bu şekilde çıkarılan metin ekranda doğru görünür ancak normal Arapça değildir: arama onu eşleştiremez ve diğer yazılımlar bunu düzgün işleyemez.
- Sipariş kayboldu. Dosya, glifleri görsel sırayla ve bunu tersine çevirecek bilgi olmadan saklarsa, okuma sırası yerine çizim sırasındaki harfleri alırsınız — klasik "ters" yapıştırma.
- Bağlantılar kopuk. Bağlantıları olmadan izole edilmiş harfleri kurtaran çıkarma işlemi, her biri ayrı ayrı doğru olan bu bağlantısız karakterler satırını üretir.
Bunun ne anlama geldiğine dikkat edin: bir Arapça metnin bir PDF'den doğru şekilde kopyalanıp kopyalanamayacağı, dosyayı üreten şeye bağlıdır, genellikle yıllar öncesine. Hiçbir okuyucu, oluşturucunun sildiği bilgileri tamamen kurtaramaz.
Metnini vermeyecek bir dosya için ne yapabilirsiniz
- Önce çıkarma yapmayı deneyin. Belge yetkin bir üreteç tarafından oluşturulmuşsa, metin oradadır ve temiz kopyalanır. Daha ağır bir şeye geçmeden önce her zaman otuz saniye değerindedir.
- Farklı bir okuyucu deneyin. Okuyucular, şekillendirmeyi tersine çevirme ve bidi'yi ele alma konusunda farklılık gösterirler. Birinden kötü yapıştırılan bir dosya, diğerinden doğru yapıştırılabilir.
- Eğer taranmışsa, hiç metin olmamıştır. O zaman ne kadar kopyalama yapılırsa yapılsın işe yaramaz ve tek yol OCR'dır—aşağıya bakın.
- Eğer çıkarma işlemi sunum biçimleri veriyorsa, metniniz olur ama tuhaf bir nitelikte. Normal Arapça ile birlikte aranabilir olması için normalleştirilmesi gerekebilir.
Arapça OCR: daha zor ve bunu açıkça belirtiyor
Belge taranmışsa, tanıma tek yoldur — ve Arapça için İngilizceye göre belirgin şekilde daha zordur. Yukarıdaki her özellik motor aleyhine çalışır: harfler birbirine bağlanır, bu yüzden karakterler arasında kesilecek temiz bir boşluk yoktur; şekiller konuma göre değişir, neyin tanınması gerektiğini çoğaltır; yukarı ve aşağı noktalar aksi takdirde aynı olan harfleri ayırt eder, böylece bir tarayıcı gürültüsü kelimeyi değiştirebilir; diakritikler mevcut olabilir veya olmayabilir.
Pratik sonuçları açıkça belirtmeye değer:
- Tarama kalitesi her zamankinden daha önemlidir. 300 dpi, yüksek kontrast, düz. Arapça ile vasat bir tarama zarifçe bozulmaz.
- Arapça modeli kullanın. OCR Arapça — Arapça metin üzerindeki İngilizce model faydalı hiçbir şey üretmez.
- Düzeltme yapmayı bekleyin. Temiz, makine basımı Arapça iyi sonuçlar verir. İyi mükemmel değildir ve hatalar genellikle anlamı değiştiren tek nokta farklılıklarıdır, bariz saçmalıklar değil.
- El yazısı desteklenmiyor. Bu herhangi bir dilde desteklenen bir kullanım durumu değil, özellikle Arapça el yazısı için öyle.
OCR, kendi cihazınızda çalışır ve CyvoDocOps Pro'nun bir parçasıdır; çünkü Pro App Store veya Google Play üzerinden değil de web üzerinden satın alınır, OCR araçları mobil uygulamada bulunur. Tanıma işleminin nasıl çalıştığına dair genel arka plan için, taranmış bir PDF'yi aranabilir yapmak kılavuzuna bakın.
Sağdan Sola (RTL) Belgelerde Damgalar ve Açıklamalar
Arap iş belgeleri, Batı'dakilerden çok daha fazla damga ve mühüre dayanır — onaylar, makbuzlar, resmi tasdikler. Bunları bir PDF'ye eklemek kendi zorluklarını getirir: damganın içindeki metnin doğru şekillendirilmesi gerekir ve yerleştirme kuralları okuma yönünü takip eder, bu nedenle soldan sağa (LTR) sayfada doğal görünen bir damga, sağdan sola (RTL) bir sayfada garip durabilir.
Arap Damgaları, metnin ayrı harfler dizisi yerine birleşik Arapça olarak işlenmesini sağlayarak şekillendirmeyi halleder — bu da Arapçayı farklı karakterlere sahip Latin gibi ele alan araçlardan elde ettiğiniz başarısızlık modudur. Tarih damgaları ve baş harfler gibi ilgili araçlar aynı deseni izler.
Arap Belgeleri İçin Pratik Alışkanlıklar
- Kaynak Dosyayı Saklayın. Belgeyi oluşturan yazılımdan gelen orijinal dosya, daha sonra kurtarılan herhangi bir şeyden her zaman daha iyi metin verecektir.
- Taahhüt etmeden önce test çıkarma yapın. Bir iş akışı Arapça PDF'leri arama işlemine bağlıysa, metnin gerçekten bir örnekten çıkıp çıkmadığını kontrol edin önce bunun etrafında inşa edilmesinden.
- Taranmışlar Yerine Gerçek Metni Tercih Edin. Doğrudan dijital bir Arap PDF'si, her zaman bir taramadan daha iyidir. Sadece kağıt tek kaynak olduğunda tarayın.
- Karmaşık içerik. Arapça ile İngilizce terimlerin, fatura numaralarının ve tarihlerinin birleştiği belgelerde bidi sorunları yoğunlaşır. Bu satırları özellikle kontrol edin.
- Görünüşüne aldanmayın. Güzel görünen bir dosya bile tarama olabilir veya kullanılamaz bir metin katmanı taşıyor olabilir. Bir kelime seçmeyi deneyin — hiçbir şey vurgulanmıyorsa, bu bir resimdir.
Yerel işlemenin burada neden önemli olduğu
Bu tür bir işleme ihtiyacı olan Arapça belgeler genellikle resmi belgelerdir: sözleşmeler, devlet evrakları, ticari kayıtlar, kimlik belgeleri, noter onaylı kayıtlar. Bu tam olarak üçüncü taraf bir hizmete yüklemenin en az uygun olduğu kategoridir — ve "bir saat sonra siliyoruz" vaadi denetleyemeyeceğiniz bir şeydir. CyvoDocOps'te desteklenen işlemler yerel olarak tarayıcınızda çalışır ve mobil uygulamadaki cihaz üzerindeki OCR, taramaları hiçbir yere göndermeden işler. Mevcut olanlar için Arapça PDF araçlarına bakın.
Sıkça Sorulan Sorular
Bir PDF'den kopyaladığım Arapça metin neden bağlantısız çıkıyor?
Çünkü PDF, önceden şekillendirilmiş glifler depolar ve gerçek karakterlere geri dönen harita eksik veya yanlıştır. Sayfa doğru çizilir; orijinal metni yeniden oluşturmak için gereken bilgi dosya yapılırken atılmıştır.
Metni yapıştırdığımda neden tersten oluyor?
Dosya, okuma sırasını kurtarmak için yeterli bilgi olmadan glifleri çizim sırasına göre depolamış. Bazı okuyucular bunu doğru bir şekilde tersine çevirirken bazıları yapmıyor — farklı bir okuyucu denemek gerçek bir çözümdür.
Arapça OCR, İngilizce kadar mı doğru?
Hayır, ve aksi iddia eden herkes abartıyor. Bağlantılı harfler, konuma bağlı şekiller ve anlam taşıyan noktalar her şeyi zorlaştırır. Temiz basılı taramalar bile iyi sonuçlar verir ancak yine de düzeltme okumasına ihtiyaç duyarlar.
Arapça taranmış bir PDF'de arama yapabilir miyim?
Metin katmanı eklenene kadar hayır. Bir tane eklemek için OCR çalıştırın — ancak, OCR'dan geçirilmiş bir belgede negatif bir arama sonucunun kelimenin mevcut olmadığı kanıtı olmadığını unutmayın.
Arapça belgelerim yüklendi mi?
Hayır. Desteklenen web işlemleri yerel olarak tarayıcınızda, mobil uygulamadaki OCR ise cihazınızda çalışır. Belge bir sunucuya gönderilmez.