CyvoDocOps
हिन्दी
Dark

scan किए गए PDF को सर्च करने योग्य कैसे बनाएं

आप पुराने अनुबंधों के चालीस पेज scan करते हैं, उन्हें एक व्यवस्थित PDF के रूप में सेव करते हैं, और "indemnity" शब्द की तलाश करते हैं। Ctrl+F कुछ नहीं ढूंढ पाता। आप शब्द देख सकते हैं — यह बारहवें पेज पर है — लेकिन आपका कंप्यूटर नहीं कर सकता, क्योंकि जहाँ तक वह जानता है उस पेज में कोई शब्द ही नहीं है। इसमें एक तस्वीर है।

तीन तरह के PDF जो एक जैसे दिखते हैं

scan से जुड़ी लगभग हर उलझन यहीं से शुरू होती है। तीन बहुत अलग फाइलें स्क्रीन पर एक जैसी दिखाई दे सकती हैं:

तीसरा प्रकार वह है जो आपको चाहिए, और OCR से आप वहाँ पहुँचते हैं।

संक्षेप में: scan टेक्स्ट की एक तस्वीर होती है। OCR उस तस्वीर को पढ़ता है और शब्दों को लिख देता है। एक सर्च करने योग्य PDF तस्वीर को बनाए रखता है और चुपचाप उसके पीछे शब्द जोड़ देता है।

OCR वास्तव में क्या करता है

ऑप्टिकल कैरेक्टर रिकग्निशन (Optical Character Recognition) पिक्सल को देखता है, उन आकृतियों को ढूंढता है जो अक्षरों जैसी दिखती हैं, और यह तय करता है कि वे कौन से अक्षर हैं। आधुनिक इंजन अक्षरों का एक-एक करके स्टेंसिल की तरह मिलान नहीं करते; वे टेक्स्ट की पंक्तियों के साथ काम करते हुए, अस्पष्टता को दूर करने के लिए और आसपास के संदर्भ का उपयोग करते हैं। यही संदर्भ है कि एक अच्छा इंजन "modern" में "rn" को दो अक्षर के रूप में पढ़ता है लेकिन एक खराब scan में भी इससे चूक सकता है — यह हर बार एक सूचित अनुमान लगा रहा होता है।

वह शब्द — अनुमान (guess) — OCR का ईमानदार सार है। यह किसी छवि की संभाव्य रीडिंग है, न कि कोई हानि-रहित रूपांतरण। आमतौर पर एक बहुत अच्छा अनुमान। कभी भी गारंटीशुदा नहीं।

एक सर्च करने योग्य PDF आमतौर पर वह होता है जो आपको चाहिए

आप scan का OCR कर सकते हैं और केवल टेक्स्ट रख सकते हैं, लेकिन आप दस्तावेज़ को फेंक देंगे: हस्ताक्षर, लेटरहेड, कॉफ़ी का दाग, लेआउट — सब कुछ जो इसे एक प्रतिलेखन के बजाय मूल बनाता है। और चूंकि OCR त्रुटिपूर्ण होता है, इसलिए शुद्ध-टेक्स्ट संस्करण को खुद की जाँच करने का कोई तरीका नहीं मिलता।

एक सर्च करने योग्य PDF इस समझौते से बचता है। scan की गई छवि वैसी ही रहती है, बिना छुए। पहचाना गया टेक्स्ट एक अदृश्य परत के रूप में जोड़ा जाता है जो उन शब्दों के ऊपर स्थित होता है जिनसे यह मेल खाता है। आप मूल देखते हैं; आपका कंप्यूटर टेक्स्ट देखता है; जब आप कोई पैराग्राफ कॉपी करते हैं तो आपको शब्द मिलते हैं, और जब पहचान त्रुटि होती है तो वास्तविक पृष्ठ अभी भी तुलना करने के लिए वहीं मौजूद होता है।

वास्तव में सटीकता को क्या चलाता है

OCR की गुणवत्ता इंजन के चलने से बहुत पहले तय हो जाती है — ज़्यादातर scan करने के समय:

यदि scan खराब आता है, तो सबसे मूल्यवान सुधार लगभग कभी भी कोई अलग OCR सेटिंग नहीं होती। यह पुन: scan करना होता है: समतल, उज्जवल, सीधा, 300 dpi पर। scanर पर दस सेकंड का समय, आउटपुट को एक घंटे तक ठीक करने से बेहतर है।

खोज योग्य PDF या सादा पाठ?

दो अलग-अलग लक्ष्य, दो अलग-अलग उपकरण, और गलत चुनना समय की बर्बादी है:

यदि आप निश्चित नहीं हैं, तो खोज योग्य PDF चुनें। आप हमेशा बाद में इससे पाठ निकाल सकते हैं; आप एक ऐसा पृष्ठ वापस नहीं पा सकते जिसे आपने त्याग दिया हो।

यह कैसे करें

CyvoDocOps में OCR आपके अपने डिवाइस पर चलता है — scan कभी भी सर्वर पर upload नहीं होता है। यह CyvoDocOps Pro का हिस्सा है, और चूंकि Pro को वेब के बजाय App Store या Google Play के माध्यम से खरीदा जाता है, इसलिए OCR उपकरण मोबाइल ऐप में रहते हैं।

  1. सबसे अच्छा scan प्राप्त करें। 300 dpi, सपाट, अच्छी रोशनी, सीधा। यह चरण किसी भी अन्य चीज़ से ज़्यादा आपके परिणाम को तय करता है।
  2. CyvoDocOps ऐप में दस्तावेज़ खोलें। यदि आपके पास नहीं है तो ऐप देखें।
  3. अपना टूल चुनें। पेज को बनाए रखने और छिपी हुई परत जोड़ने के लिए Searchable PDF; शब्दों को निकालने के लिए Extract Text; या जिस भाषा में आप पढ़ रहे हैं, उसके लिए OCR English या OCR Arabic
  4. परिणाम की जाँच करें। एक ऐसे शब्द को खोजें जो आपको पता है कि पेज एक पर है। यदि यह नहीं मिलता है, तो इसका मतलब है कि पहचान करने में संघर्ष हुआ — जो आमतौर पर scan की ओर इशारा करता है।

CyvoDocOps ऐप प्राप्त करें

सीमाओं के बारे में स्पष्ट होना

अरबी और अन्य लिपियाँ

पहचान की कठिनाई लिपि के अनुसार बहुत भिन्न होती है। अरबी अंग्रेजी की तुलना में काफी कठिन है: अक्षर जुड़ते हैं, उनके आकार शब्द में स्थिति के अनुसार बदलते हैं, डायक्रिटिक्स का अर्थ होता है, और पाठ दाएँ से बाएँ चलता है। अंग्रेजी के लिए प्रशिक्षित मॉडल इस पर बेकार है — आपको OCR Arabic के माध्यम से अरबी मॉडल की आवश्यकता है। यदि यह आपका उपयोग मामला है, तो अरबी PDFs के साथ काम करना विशिष्ट विवरणों को कवर करता है।

यहां ऑन-डिवाइस क्यों मायने रखता है

सोचिए कि लोग वास्तव में क्या scan करते हैं: अनुबंध, मेडिकल पत्र, बैंक स्टेटमेंट, पासपोर्ट, टैक्स रिकॉर्ड। scanिंग वह है जो आप कागज़ पर मौजूद दस्तावेज़ों के साथ करते हैं क्योंकि वे महत्वपूर्ण होते हैं। उस ढेर को किसी और के सर्वर पर प्रोसेसिंग के लिए भेजना एक अजीब सौदा है — और यह आम भी है, क्योंकि अधिकांश OCR सेवाओं के पास काम करने का कोई अन्य तरीका नहीं होता। अपने स्वयं के डिवाइस पर पहचान चलाने से दस्तावेज़ वहीं रहता है जहां वह शुरू हुआ था। कुछ भी upload नहीं किया जाता है, इसलिए रिटेन, लॉग या लीक करने के लिए कुछ भी नहीं होता है।

अक्सर पूछे जाने वाले प्रश्न

मैं अपने scan किए गए PDF में क्यों खोज नहीं कर सकता?

क्योंकि इसमें कोई टेक्स्ट नहीं है। प्रत्येक पेज एक इमेज होता है, और सर्च अक्षरों को ढूंढता है। OCR वह प्रक्रिया है जो तस्वीर को उन शब्दों में बदल देती है जिन्हें आपका कंप्यूटर खोज सकता है।

क्या PDF को searchable बनाना इसके दिखने के तरीके को बदल देता है?

नहीं। scan की गई इमेज को बिल्कुल वैसा ही रखा जाता है। पहचाना गया टेक्स्ट इसके पीछे एक अदृश्य परत के रूप में जोड़ दिया जाता है।

क्या OCR हस्तलेखन पर काम करेगा?

नहीं। यह इंजन मशीन-प्रिंटेड टेक्स्ट के लिए डिज़ाइन किया गया है। हस्तलेखन एक अलग समस्या है और यह समर्थित उपयोग का मामला नहीं है।

OCR ऐप में क्यों है न कि browser में?

यह CyvoDocOps Pro का हिस्सा है, और Pro को App Store या Google Play के माध्यम से खरीदा जाता है — कोई वेब चेकआउट नहीं है — इसलिए उपकरण ऐप में रहते हैं। पहचान (recognition) दोनों ही मामलों में आपके डिवाइस पर चलती है।

क्या मेरा scan OCR के लिए upload किया गया है?

कोई भी Recognition पूरी तरह से आपके डिवाइस पर चलता है और दस्तावेज़ को किसी सर्वर पर नहीं भेजा जाता है।

संबंधित गाइड और टूल्स