CyvoDocOps
Türkçe
Dark

Arapça PDF'lerle Çalışma

Bir Arapça sözleşme açıyorsunuz, bir paragraf seçiyor, kopyalıyor ve bir e-postaya yapıştırıyorsunuz. Ortaya çıkan şey kopuk harflerden oluşan bir satır oluyor — ya da doğru harfler yanlış sırada, ya da neredeyse doğru görünen ama öyle olmayan bir karakter dizisi. PDF mükemmel görünüyor. Metni çıkarmaya çalıştığınız anda dağılıyor. Bu sizin yazılımınızın bozuk olduğu anlamına gelmiyor. Bu, gerçekten zor bir problemin ortaya çıkmasıdır.

Arapça'nın Latin alfabesinden daha zor olmasının nedeni

İngilizce bir metin sistemi çok az şey ister: harfler soldan sağa, tek sıra halinde yerleşir ve her yerde aynı şekle sahiptir. Arapça ise çok daha fazlasını gerektirir ve bu özelliklerin her biri araçların yanlış yapabileceği bir noktadır:

Bu nedenle Arapçayı doğru bir şekilde görüntülemek, işleyicinin her harf için komşularına göre doğru şekli seçmesini ve ardından karışık yönlü dizileri tutarlı bir şekilde yerleştirmesini gerektirir. Sorun bu iki adımda ortaya çıkıyor.

Kısa versiyonu: Bir PDF, harflerin resimlerini ve bunları nereye çizeceğine dair bir not depolar. Latin alfabesi için genellikle resimden karaktere doğru geriye dönük çalışabilirsiniz. Arapça için ise bu yol kayıplıdır — bu yüzden sayfa mükemmel görünür ama kopyalanan metin olmaz.

Şekillendirme ve Kopyala-Yapıştır Neden Bozulur

İşte mekanizma, çünkü bunu bilmek karşılaşacağınız her semptomu açıklar.

Metin, mantıksal sırayla — söyleyeceğiniz sıra ile — depolanır. Çizilmeden önce yazılım şekillendirme uygular: her harf için doğru konumlandırma formunu seçmek ve ayrıca bidi (iki yönlü algoritma), bu da sağdan sola ve soldan sağa dizilerin satır üzerinde nasıl iç içe geçtiğini hesaplar.

Ancak bir PDF, cümlenizi depolamaz. Glifleri — bir yazı tipindeki indeksleri — artı konumları depolar. Şekillendirme zaten gerçekleşmiş ve içine gömülmüştür. Metni tekrar kopyalamak için okuyucunun gliften karaktere bir haritaya ihtiyacı vardır; bu da dosya tarafından ToUnicode tablosu olarak dahil edilebilir. Ve işte püf noktası:

Bunun ne anlama geldiğine dikkat edin: bir Arapça metnin bir PDF'den doğru şekilde kopyalanıp kopyalanamayacağı, dosyayı üreten şeye bağlıdır, genellikle yıllar öncesine. Hiçbir okuyucu, oluşturucunun sildiği bilgileri tamamen kurtaramaz.

Metnini vermeyecek bir dosya için ne yapabilirsiniz

  1. Önce çıkarma yapmayı deneyin. Belge yetkin bir üreteç tarafından oluşturulmuşsa, metin oradadır ve temiz kopyalanır. Daha ağır bir şeye geçmeden önce her zaman otuz saniye değerindedir.
  2. Farklı bir okuyucu deneyin. Okuyucular, şekillendirmeyi tersine çevirme ve bidi'yi ele alma konusunda farklılık gösterirler. Birinden kötü yapıştırılan bir dosya, diğerinden doğru yapıştırılabilir.
  3. Eğer taranmışsa, hiç metin olmamıştır. O zaman ne kadar kopyalama yapılırsa yapılsın işe yaramaz ve tek yol OCR'dır—aşağıya bakın.
  4. Eğer çıkarma işlemi sunum biçimleri veriyorsa, metniniz olur ama tuhaf bir nitelikte. Normal Arapça ile birlikte aranabilir olması için normalleştirilmesi gerekebilir.

Arapça OCR: daha zor ve bunu açıkça belirtiyor

Belge taranmışsa, tanıma tek yoldur — ve Arapça için İngilizceye göre belirgin şekilde daha zordur. Yukarıdaki her özellik motor aleyhine çalışır: harfler birbirine bağlanır, bu yüzden karakterler arasında kesilecek temiz bir boşluk yoktur; şekiller konuma göre değişir, neyin tanınması gerektiğini çoğaltır; yukarı ve aşağı noktalar aksi takdirde aynı olan harfleri ayırt eder, böylece bir tarayıcı gürültüsü kelimeyi değiştirebilir; diakritikler mevcut olabilir veya olmayabilir.

Pratik sonuçları açıkça belirtmeye değer:

OCR, kendi cihazınızda çalışır ve CyvoDocOps Pro'nun bir parçasıdır; çünkü Pro App Store veya Google Play üzerinden değil de web üzerinden satın alınır, OCR araçları mobil uygulamada bulunur. Tanıma işleminin nasıl çalıştığına dair genel arka plan için, taranmış bir PDF'yi aranabilir yapmak kılavuzuna bakın.

Sağdan Sola (RTL) Belgelerde Damgalar ve Açıklamalar

Arap iş belgeleri, Batı'dakilerden çok daha fazla damga ve mühüre dayanır — onaylar, makbuzlar, resmi tasdikler. Bunları bir PDF'ye eklemek kendi zorluklarını getirir: damganın içindeki metnin doğru şekillendirilmesi gerekir ve yerleştirme kuralları okuma yönünü takip eder, bu nedenle soldan sağa (LTR) sayfada doğal görünen bir damga, sağdan sola (RTL) bir sayfada garip durabilir.

Arap Damgaları, metnin ayrı harfler dizisi yerine birleşik Arapça olarak işlenmesini sağlayarak şekillendirmeyi halleder — bu da Arapçayı farklı karakterlere sahip Latin gibi ele alan araçlardan elde ettiğiniz başarısızlık modudur. Tarih damgaları ve baş harfler gibi ilgili araçlar aynı deseni izler.

Arap Belgeleri İçin Pratik Alışkanlıklar

Yerel işlemenin burada neden önemli olduğu

Bu tür bir işleme ihtiyacı olan Arapça belgeler genellikle resmi belgelerdir: sözleşmeler, devlet evrakları, ticari kayıtlar, kimlik belgeleri, noter onaylı kayıtlar. Bu tam olarak üçüncü taraf bir hizmete yüklemenin en az uygun olduğu kategoridir — ve "bir saat sonra siliyoruz" vaadi denetleyemeyeceğiniz bir şeydir. CyvoDocOps'te desteklenen işlemler yerel olarak tarayıcınızda çalışır ve mobil uygulamadaki cihaz üzerindeki OCR, taramaları hiçbir yere göndermeden işler. Mevcut olanlar için Arapça PDF araçlarına bakın.

Arapça PDF araçlarını görün

Sıkça Sorulan Sorular

Bir PDF'den kopyaladığım Arapça metin neden bağlantısız çıkıyor?

Çünkü PDF, önceden şekillendirilmiş glifler depolar ve gerçek karakterlere geri dönen harita eksik veya yanlıştır. Sayfa doğru çizilir; orijinal metni yeniden oluşturmak için gereken bilgi dosya yapılırken atılmıştır.

Metni yapıştırdığımda neden tersten oluyor?

Dosya, okuma sırasını kurtarmak için yeterli bilgi olmadan glifleri çizim sırasına göre depolamış. Bazı okuyucular bunu doğru bir şekilde tersine çevirirken bazıları yapmıyor — farklı bir okuyucu denemek gerçek bir çözümdür.

Arapça OCR, İngilizce kadar mı doğru?

Hayır, ve aksi iddia eden herkes abartıyor. Bağlantılı harfler, konuma bağlı şekiller ve anlam taşıyan noktalar her şeyi zorlaştırır. Temiz basılı taramalar bile iyi sonuçlar verir ancak yine de düzeltme okumasına ihtiyaç duyarlar.

Arapça taranmış bir PDF'de arama yapabilir miyim?

Metin katmanı eklenene kadar hayır. Bir tane eklemek için OCR çalıştırın — ancak, OCR'dan geçirilmiş bir belgede negatif bir arama sonucunun kelimenin mevcut olmadığı kanıtı olmadığını unutmayın.

Arapça belgelerim yüklendi mi?

Hayır. Desteklenen web işlemleri yerel olarak tarayıcınızda, mobil uygulamadaki OCR ise cihazınızda çalışır. Belge bir sunucuya gönderilmez.

İlgili kılavuzlar ve araçlar