scan किए गए PDF को सर्च करने योग्य कैसे बनाएं
आप पुराने अनुबंधों के चालीस पेज scan करते हैं, उन्हें एक व्यवस्थित PDF के रूप में सेव करते हैं, और "indemnity" शब्द की तलाश करते हैं। Ctrl+F कुछ नहीं ढूंढ पाता। आप शब्द देख सकते हैं — यह बारहवें पेज पर है — लेकिन आपका कंप्यूटर नहीं कर सकता, क्योंकि जहाँ तक वह जानता है उस पेज में कोई शब्द ही नहीं है। इसमें एक तस्वीर है।
तीन तरह के PDF जो एक जैसे दिखते हैं
scan से जुड़ी लगभग हर उलझन यहीं से शुरू होती है। तीन बहुत अलग फाइलें स्क्रीन पर एक जैसी दिखाई दे सकती हैं:
- एक मूल डिजिटल PDF। वर्ड प्रोसेसर से निर्यात किया गया। यह वास्तविक अक्षरों और वास्तविक फ़ॉन्ट को स्टोर करता है। सर्च, सिलेक्शन और कॉपी सब काम करते हैं क्योंकि टेक्स्ट वास्तव में टेक्स्ट होता है।
- केवल छवि वाला PDF। scanर या फ़ोन कैमरे से लिया गया। हर पेज एक बड़ी तस्वीर होती है। फाइल में कोई टेक्स्ट नहीं होता — केवल पिक्सल जो टेक्स्ट जैसे दिखते हैं। यही चीज़ Ctrl+F को विफल कर देती है।
- सर्च करने योग्य PDF। scan प्लस एक अदृश्य टेक्स्ट लेयर। यह केवल छवि वाले संस्करण जैसा दिखता है — वही तस्वीर, वही पेज — लेकिन टेक्स्ट इसके पीछे होता है, इसलिए सर्च और कॉपी काम करते हैं।
तीसरा प्रकार वह है जो आपको चाहिए, और OCR से आप वहाँ पहुँचते हैं।
OCR वास्तव में क्या करता है
ऑप्टिकल कैरेक्टर रिकग्निशन (Optical Character Recognition) पिक्सल को देखता है, उन आकृतियों को ढूंढता है जो अक्षरों जैसी दिखती हैं, और यह तय करता है कि वे कौन से अक्षर हैं। आधुनिक इंजन अक्षरों का एक-एक करके स्टेंसिल की तरह मिलान नहीं करते; वे टेक्स्ट की पंक्तियों के साथ काम करते हुए, अस्पष्टता को दूर करने के लिए और आसपास के संदर्भ का उपयोग करते हैं। यही संदर्भ है कि एक अच्छा इंजन "modern" में "rn" को दो अक्षर के रूप में पढ़ता है लेकिन एक खराब scan में भी इससे चूक सकता है — यह हर बार एक सूचित अनुमान लगा रहा होता है।
वह शब्द — अनुमान (guess) — OCR का ईमानदार सार है। यह किसी छवि की संभाव्य रीडिंग है, न कि कोई हानि-रहित रूपांतरण। आमतौर पर एक बहुत अच्छा अनुमान। कभी भी गारंटीशुदा नहीं।
एक सर्च करने योग्य PDF आमतौर पर वह होता है जो आपको चाहिए
आप scan का OCR कर सकते हैं और केवल टेक्स्ट रख सकते हैं, लेकिन आप दस्तावेज़ को फेंक देंगे: हस्ताक्षर, लेटरहेड, कॉफ़ी का दाग, लेआउट — सब कुछ जो इसे एक प्रतिलेखन के बजाय मूल बनाता है। और चूंकि OCR त्रुटिपूर्ण होता है, इसलिए शुद्ध-टेक्स्ट संस्करण को खुद की जाँच करने का कोई तरीका नहीं मिलता।
एक सर्च करने योग्य PDF इस समझौते से बचता है। scan की गई छवि वैसी ही रहती है, बिना छुए। पहचाना गया टेक्स्ट एक अदृश्य परत के रूप में जोड़ा जाता है जो उन शब्दों के ऊपर स्थित होता है जिनसे यह मेल खाता है। आप मूल देखते हैं; आपका कंप्यूटर टेक्स्ट देखता है; जब आप कोई पैराग्राफ कॉपी करते हैं तो आपको शब्द मिलते हैं, और जब पहचान त्रुटि होती है तो वास्तविक पृष्ठ अभी भी तुलना करने के लिए वहीं मौजूद होता है।
वास्तव में सटीकता को क्या चलाता है
OCR की गुणवत्ता इंजन के चलने से बहुत पहले तय हो जाती है — ज़्यादातर scan करने के समय:
- रिज़ॉल्यूशन। मुद्रित पाठ के लिए लगभग 300 dpi सबसे अच्छा होता है। 200 से नीचे, वर्णों में उन्हें अलग करने के लिए आवश्यक विवरण खो जाता है। 400 से ऊपर आप ज़्यादातर फ़ाइल को बड़ा बना रहे होते हैं, पढ़ने को बेहतर नहीं।
- कंट्रास्ट। साफ़ सफेद पर कुरकुरा काला आदर्श होता है। ग्रे फोटोकॉपी, रंगीन कागज़ और पन्ने पर छाया आपकी सटीकता की कीमत घटाते हैं।
- सीधापन। झुकाव (Skew) एक वास्तविक दुश्मन है। कोण पर खींची गई या स्पाइन के पास किताब के वक्र के साथ फ़ोटो की गई कोई भी पन्ना, इंजन को अनुसरण करने के लिए मुड़ी हुई बेसलाइन देती है।
- प्रिंट गुणवत्ता। साफ़ मशीन प्रिंट अच्छी तरह से पढ़ा जाता है। फैक्स, तीसरी पीढ़ी की फोटोकॉपी, डॉट-मैट्रिक्स आउटपुट और स्टैम्प किया हुआ पाठ काफी खराब पढ़ा जाता है।
- सही भाषा। इंजन अस्पष्टता को हल करने के लिए एक भाषा मॉडल का उपयोग करता है। फ्रेंच दस्तावेज़ पर अंग्रेजी मॉडल चलाना परिणाम ख़राब कर देता है, भले ही वर्णमाला मेल खाती हो।
- हस्तलेख — नहीं। यह इंजन मशीन-मुद्रित पाठ के लिए बनाया गया है। हस्तलेख पहचान एक वास्तव में अलग समस्या है और यह कोई समर्थित उपयोग मामला नहीं है। यदि आपका दस्तावेज़ हाथ से लिखा हुआ है, तो OCR आत्मविश्वासपूर्ण बकवास उत्पन्न करेगा।
यदि scan खराब आता है, तो सबसे मूल्यवान सुधार लगभग कभी भी कोई अलग OCR सेटिंग नहीं होती। यह पुन: scan करना होता है: समतल, उज्जवल, सीधा, 300 dpi पर। scanर पर दस सेकंड का समय, आउटपुट को एक घंटे तक ठीक करने से बेहतर है।
खोज योग्य PDF या सादा पाठ?
दो अलग-अलग लक्ष्य, दो अलग-अलग उपकरण, और गलत चुनना समय की बर्बादी है:
- आप चाहते हैं कि दस्तावेज़ एक दस्तावेज़ बना रहे — खोज योग्य, कॉपी करने योग्य, संग्रहीत, अभी भी मूल जैसा दिख रहा हो। वह है खोज योग्य PDF। अनुबंधों, रिकॉर्डों, या किसी भी चीज़ के लिए सबसे अच्छा जो आपको बाद में वैसा ही प्रस्तुत करने की आवश्यकता हो सकता है।
- आप शब्द चाहते हैं — जिन्हें ईमेल में पेस्ट किया जा सके, स्प्रेडशीट में फीड किया जा सके, रिपोर्ट में उद्धृत किया जा सके। वह है पाठ निकालना (Extract Text), जो आपको सादा पाठ देता है और लेआउट को त्याग देता है।
यदि आप निश्चित नहीं हैं, तो खोज योग्य PDF चुनें। आप हमेशा बाद में इससे पाठ निकाल सकते हैं; आप एक ऐसा पृष्ठ वापस नहीं पा सकते जिसे आपने त्याग दिया हो।
यह कैसे करें
CyvoDocOps में OCR आपके अपने डिवाइस पर चलता है — scan कभी भी सर्वर पर upload नहीं होता है। यह CyvoDocOps Pro का हिस्सा है, और चूंकि Pro को वेब के बजाय App Store या Google Play के माध्यम से खरीदा जाता है, इसलिए OCR उपकरण मोबाइल ऐप में रहते हैं।
- सबसे अच्छा scan प्राप्त करें। 300 dpi, सपाट, अच्छी रोशनी, सीधा। यह चरण किसी भी अन्य चीज़ से ज़्यादा आपके परिणाम को तय करता है।
- CyvoDocOps ऐप में दस्तावेज़ खोलें। यदि आपके पास नहीं है तो ऐप देखें।
- अपना टूल चुनें। पेज को बनाए रखने और छिपी हुई परत जोड़ने के लिए Searchable PDF; शब्दों को निकालने के लिए Extract Text; या जिस भाषा में आप पढ़ रहे हैं, उसके लिए OCR English या OCR Arabic।
- परिणाम की जाँच करें। एक ऐसे शब्द को खोजें जो आपको पता है कि पेज एक पर है। यदि यह नहीं मिलता है, तो इसका मतलब है कि पहचान करने में संघर्ष हुआ — जो आमतौर पर scan की ओर इशारा करता है।
सीमाओं के बारे में स्पष्ट होना
- OCR कभी भी 100% सटीक नहीं होता। साफ scan पर भी त्रुटियाँ होती हैं — एक अंक गलत पढ़ा गया, एक हाइफ़न खो गया। अच्छा का मतलब उत्तम नहीं है, और जब संख्या किसी भुगतान राशि की हो तो यह अंतर मायने रखता है।
- नेगेटिव सर्च पर भरोसा न करें। यदि Ctrl+F से "indemnity" नहीं मिलता है, तो इसका मतलब यह हो सकता है कि शब्द वहाँ नहीं है, या OCR ने इसे "indernnity" पढ़ा होगा। एक OCR किए गए दस्तावेज़ में हिट की अनुपस्थिति अनुपस्थिति का प्रमाण नहीं है — यह एक महत्वपूर्ण अंतर है यदि आप कानूनी या चिकित्सा उद्देश्यों के लिए रिकॉर्ड खोज रहे हैं।
- टेबल्स और कॉलम मुश्किल होते हैं। पहचान पाठ की पंक्तियों का अनुसरण करती है; जटिल लेआउट में कॉलम आपस में मिल सकते हैं या टेबल सेल अस्त-व्यस्त हो सकते हैं, भले ही हर व्यक्तिगत वर्ण को सही ढंग से पढ़ा गया हो।
- टेक्स्ट लेयर गलत हो सकती है जबकि पेज सही हो। यह डिज़ाइन का काम है जैसा कि इरादा किया गया है — छवि रिकॉर्ड है, और टेक्स्ट इंडेक्स है — लेकिन परत (layer) से उद्धरण न लें बिना पेज को देखे।
अरबी और अन्य लिपियाँ
पहचान की कठिनाई लिपि के अनुसार बहुत भिन्न होती है। अरबी अंग्रेजी की तुलना में काफी कठिन है: अक्षर जुड़ते हैं, उनके आकार शब्द में स्थिति के अनुसार बदलते हैं, डायक्रिटिक्स का अर्थ होता है, और पाठ दाएँ से बाएँ चलता है। अंग्रेजी के लिए प्रशिक्षित मॉडल इस पर बेकार है — आपको OCR Arabic के माध्यम से अरबी मॉडल की आवश्यकता है। यदि यह आपका उपयोग मामला है, तो अरबी PDFs के साथ काम करना विशिष्ट विवरणों को कवर करता है।
यहां ऑन-डिवाइस क्यों मायने रखता है
सोचिए कि लोग वास्तव में क्या scan करते हैं: अनुबंध, मेडिकल पत्र, बैंक स्टेटमेंट, पासपोर्ट, टैक्स रिकॉर्ड। scanिंग वह है जो आप कागज़ पर मौजूद दस्तावेज़ों के साथ करते हैं क्योंकि वे महत्वपूर्ण होते हैं। उस ढेर को किसी और के सर्वर पर प्रोसेसिंग के लिए भेजना एक अजीब सौदा है — और यह आम भी है, क्योंकि अधिकांश OCR सेवाओं के पास काम करने का कोई अन्य तरीका नहीं होता। अपने स्वयं के डिवाइस पर पहचान चलाने से दस्तावेज़ वहीं रहता है जहां वह शुरू हुआ था। कुछ भी upload नहीं किया जाता है, इसलिए रिटेन, लॉग या लीक करने के लिए कुछ भी नहीं होता है।
अक्सर पूछे जाने वाले प्रश्न
मैं अपने scan किए गए PDF में क्यों खोज नहीं कर सकता?
क्योंकि इसमें कोई टेक्स्ट नहीं है। प्रत्येक पेज एक इमेज होता है, और सर्च अक्षरों को ढूंढता है। OCR वह प्रक्रिया है जो तस्वीर को उन शब्दों में बदल देती है जिन्हें आपका कंप्यूटर खोज सकता है।
क्या PDF को searchable बनाना इसके दिखने के तरीके को बदल देता है?
नहीं। scan की गई इमेज को बिल्कुल वैसा ही रखा जाता है। पहचाना गया टेक्स्ट इसके पीछे एक अदृश्य परत के रूप में जोड़ दिया जाता है।
क्या OCR हस्तलेखन पर काम करेगा?
नहीं। यह इंजन मशीन-प्रिंटेड टेक्स्ट के लिए डिज़ाइन किया गया है। हस्तलेखन एक अलग समस्या है और यह समर्थित उपयोग का मामला नहीं है।
OCR ऐप में क्यों है न कि browser में?
यह CyvoDocOps Pro का हिस्सा है, और Pro को App Store या Google Play के माध्यम से खरीदा जाता है — कोई वेब चेकआउट नहीं है — इसलिए उपकरण ऐप में रहते हैं। पहचान (recognition) दोनों ही मामलों में आपके डिवाइस पर चलती है।
क्या मेरा scan OCR के लिए upload किया गया है?
कोई भी Recognition पूरी तरह से आपके डिवाइस पर चलता है और दस्तावेज़ को किसी सर्वर पर नहीं भेजा जाता है।