corrupted PDF को कैसे ठीक करें
"फ़ाइल क्षतिग्रस्त है और इसे ठीक नहीं किया जा सका।" यह चालीस पन्नों का काम है, कल ही खुला था, और समय सीमा एक घंटे में है। इससे पहले कि आप इस नतीजे को स्वीकार करें: वह संदेश आपके पाठक द्वारा यह मान लेना है कि वह फ़ाइल समझ नहीं पाया। यह कोई फोरेंसिक रिपोर्ट नहीं है, और यह अक्सर गलत होता है जितना आप सोचते हैं।
PDF के अंदर वास्तव में क्या होता है
यह समझने के लिए कि PDF क्यों टूटते हैं — और क्यों वे अक्सर recoverable होते हैं — यह जानना सहायक है कि इसे कैसे बनाया जाता है। एक PDF संख्यांकित ऑब्जेक्ट्स का संग्रह है: पेज, फ़ॉन्ट, इमेज, टेक्स्ट के ब्लॉक। ये पूरे फ़ाइल में बिखरे होते हैं, किसी विशेष क्रम में नहीं।
कुछ भी खोजने के लिए, रीडर फ़ाइल के अंत में एक इंडेक्स देखता है — क्रॉस-रेफरेंस टेबल। यह एक लुकअप है: ऑब्जेक्ट 47 बाइट 981,204 पर शुरू होता है। रीडर फ़ाइल खोलता है, अंत तक जाता है, इंडेक्स पढ़ता है, और बाकी सब कुछ खोजने के लिए इसका उपयोग करता है।
इसी डिज़ाइन के कारण PDF बड़े दस्तावेज़ों को तुरंत खोलते हैं: रीडर पहले 299 पेज पढ़ने के बजाय सीधे पेज 300 प्राप्त करता है। यह एक सिंगल पॉइंट ऑफ़ फ़ेलियर भी बनाता है। यदि इंडेक्स गलत है, तो रीडर कुछ भी नहीं ढूंढ सकता — भले ही सब कुछ अभी भी मौजूद हो।
वे कैसे टूटते हैं
- अधूरे ट्रांसफर। एक रुका हुआ डाउनलोड, पूरी डिस्क, या फोन जिसमें सेव करते समय जगह खत्म हो गई। फ़ाइल जल्दी समाप्त होती है — और चूंकि इंडेक्स अंत में रहता है, इसलिए सबसे पहली क्षति मैप को होती है।
- स्टोरेज हटाना बहुत जल्दी। जब कोई फ़ाइल लिखी जा रही हो तो USB स्टिक खींच लेना या नेटवर्क कनेक्शन खो देना। राइट पूरा हुआ बताया जाता है; आखिरी हिस्सा कभी लैंड नहीं करता।
- सिंक संघर्ष (Sync conflicts)। क्लाउड फ़ोल्डर दो वर्ज़न की फ़ाइलों को मिलाते हैं जो दोनों बदल गए थे। परिणाम एक ऐसा मिश्रण हो सकता है जो किसी के लिए भी मान्य न हो।
- सॉफ्टवेयर जो खराब फ़ाइलें लिखता है। सभी PDF जनरेटर सावधान नहीं होते, और कुछ तकनीकी रूप से अमान्य फ़ाइलें उत्पन्न करते हैं जिन्हें शिथिल पाठक वर्षों तक सहन कर लेते हैं — जब तक कि कोई सख्त पाठक मना न करे।
- वास्तविक मीडिया विफलता। एक विफल ड्राइव जगह पर बाइट्स को दूषित करना। यह सबसे दुर्लभ और सबसे गंभीर कारण है, क्योंकि यहां डेटा वास्तव में चला जाता है।
कुछ भी ठीक करने से पहले: क्या यह वास्तव में टूटा हुआ है?
दो मिनट की जाँच से बहुत परेशानी बच जाती है, क्योंकि आश्चर्यजनक संख्या में "क्षतिग्रस्त" फ़ाइलें ठीक होती हैं कि:
- इसे किसी अन्य रीडर में खोलें। यदि आपने डेस्कटॉप ऐप का उपयोग किया है और browser से खोला जा रहा है, या इसके विपरीत, तो एक browser या डेस्कटॉप ऐप आज़माएँ। रीडर्स की सख्ती बहुत भिन्न होती है — जो फ़ाइल एक रीडर अस्वीकार करता है वह कहीं और पूरी तरह खुल सकती है। यह अकेले कई मामलों को हल कर देता है।
- फ़ाइल का आकार जाँचें। यदि 12 MB का दस्तावेज़ अब 400 KB का हो गया है, तो इसका मतलब है कि वह ट्रंकेट (truncated) हो गया है और गायब बाइट्स बस वहाँ नहीं हैं। यदि यह 0 KB है, तो इसे ठीक करने के लिए कुछ भी नहीं है; किसी बैकअप की तलाश करें।
- स्रोत से पुनः प्रयास करें। यदि यह डाउनलोड या ईमेल द्वारा आया था, तो इसे फिर से प्राप्त करें। एक ताज़ी कॉपी एक संपूर्ण समाधान है, और दूषित डाउनलोड सबसे आम कारण होता है।
- क्या यह क्षतिग्रस्त है, या एन्क्रिप्टेड? कुछ रीडर असामान्य एन्क्रिप्शन स्कीम के साथ password-संरक्षित फ़ाइल को "क्षतिग्रस्त" बता सकते हैं। यदि यह सुरक्षित हो सकता है, तो वह एक अलग समस्या है — PDF passwords explained देखें।
मरम्मत वास्तव में क्या करती है
यदि फ़ाइल वास्तव में खराब स्वरूपित (malformed) है, तो मरम्मत आपके पेजों पर सर्जरी नहीं करती है। यह टूटे हुए इंडेक्स को अनदेखा करती है और शुरुआत से फ़ाइल पढ़ती है, किसी भी चीज़ की scanिंग करती है जो एक वैध ऑब्जेक्ट जैसी दिखती है और नोट करती है कि प्रत्येक वस्तु वास्तव में कहाँ स्थित है। बचे हुए तत्वों से यह क्रॉस-रेफरेंस टेबल का पुनर्निर्माण करती है और दस्तावेज़ को फिर से जोड़ती है।
इसी कारण परिणाम तीन समूहों में बँट जाते हैं:
- पूर्ण रिकवरी। सभी ऑब्जेक्ट बरकरार थे; केवल मैप गलत था। यह सामान्य और सबसे अच्छा मामला है — आपको अपना दस्तावेज़ ठीक वैसा ही वापस मिल जाता है।
- आंशिक रिकवरी। कुछ ऑब्जेक्ट क्षतिग्रस्त या गायब हैं। आपको वे पेज मिलेंगे जो बचे हैं। एक कटा हुआ (truncated) फ़ाइल आमतौर पर अपने शुरुआती पेज को पुनर्प्राप्त करती है और अंत (tail) खो देती है, क्योंकि फ़ाइलों को आगे से पीछे की ओर लिखा जाता है।
- कुछ नहीं। यदि फ़ाइल एक खंड (fragment) है, या बाइट्स अस्त-व्यस्त हैं, तो कुछ भी सुसंगत खोजने के लिए नहीं है। कोई भी टूल उस डेटा को पुनर्प्राप्त नहीं कर सकता जो फ़ाइल में मौजूद नहीं है।
PDF कैसे ठीक करें
- हमेशा एक कॉपी पर काम करें। हमेशा। पहले क्षतिग्रस्त फ़ाइल की डुप्लीकेट बनाएं, ताकि किसी असफल प्रयास से आपको कुछ न खोना पड़े और आप बाद में कुछ और आज़मा सकें।
- रिपेयर टूल खोलें। Repair PDF पर जाएं। यह आपके browser में चलता है।
- क्षतिग्रस्त फ़ाइल लोड करें और परिणाम निर्यात करें।
- हर पेज की जाँच करें — सिर्फ पहले वाले की नहीं। यह मायने रखता है। आंशिक रिकवरी पेज एक पर सफलता जैसी दिखती है और पेज तीस पर खुद को प्रकट करती है। इस पर भरोसा करने से पहले पूरे दस्तावेज़ को स्क्रॉल करें।
- जो आप पुनर्प्राप्त करते हैं उसे री-सेव करें। यदि यह खुलता है, तो तुरंत उस कॉपी को कहीं सुरक्षित जगह रखें।
वास्तविक उम्मीदें रखना
ऐसे रिपेयर टूल्स जो वादा करते हैं कि वे किसी भी PDF को ठीक कर देंगे, वह कुछ ऐसा वादा कर रहे हैं जो कोई सॉफ्टवेयर डिलीवर नहीं कर सकता। सीमाएँ भौतिकी की हैं, प्रयास की नहीं:
- गायब बाइट्स गायब ही रहेंगे। यदि डाउनलोड 40% पर रुक गया था, तो बाकी के 60% कहीं भी आपके फ़ाइल में मौजूद नहीं है। पुनर्निर्माण आविष्कार नहीं है।
- रिकवर किए गए पेजों की सटीकता कम हो सकती है। यदि कोई फॉन्ट या इमेज ऑब्जेक्ट क्षतिग्रस्त था, तो एक पेज वैकल्पिक फॉन्ट्स के साथ या ग्राफिक्स की कमी के साथ वापस आ सकता है। पढ़ने योग्य, लेकिन समान नहीं।
- एन्क्रिप्टेड क्षति और भी खराब होती है। किसी एन्क्रिप्टेड फ़ाइल के अंदर भ्रष्टाचार (corruption) को आमतौर पर बायपास नहीं किया जा सकता, क्योंकि डिक्रिप्ट करने के लिए आवश्यक संरचना स्वयं अपठनीय होती है।
- रिपेयर की गई फ़ाइल मूल नहीं होती। इसे फिर से बनाया गया होता है। यदि दस्तावेज़ की बाइट-दर-बाइट पहचान मायने रखती है — मान लीजिए एक हैश्ड कॉन्ट्रैक्ट — तो एक रिपेयर की गई कॉपी इसके पुराने हैश से मेल नहीं खाएगी, और यह संदिग्ध होने के बजाय अपेक्षित है। यह साबित करना कि दस्तावेज़ में बदलाव नहीं आया देखें।
अगले को न खोना
अधिकांश दूषित PDF बनाए जाते हैं, न कि जन्म से:
- नेटवर्क ड्राइव या क्लाउड फ़ोल्डरों पर दस्तावेज़ों को सीधे संपादित न करें। स्थानीय रूप से कॉपी करें, काम करें, और वापस कॉपी करें। अधिकांश सिंक संघर्ष और अधूरे लिखे गए फ़ाइलें यहीं से शुरू होते हैं।
- स्थानांतरण को पूरा होने दें। स्टोरेज को ठीक से इजेक्ट करें; ढक्कन बंद करने से पहले upload के पूरा होने का इंतज़ार करें।
- स्रोत को बनाए रखें। मूल scan, मूल निर्यात। एक पुनर्जीवित फ़ाइल हमेशा एक मरम्मत की गई फ़ाइल से बेहतर होती है।
- महत्वपूर्ण दस्तावेज़ों के लिए, कहीं और एक प्रति रखें। मरम्मत वह है जो आप तब करते हैं जब बैकअप नहीं हुआ होता।
स्थानीय रूप से क्यों ठीक करें?
एक क्षतिग्रस्त फ़ाइल अभी भी एक गोपनीय फ़ाइल होती है। वह अनुबंध जिसे आप खोल नहीं सकते, वही अनुबंध है जिसे आप कल upload नहीं कर पाए थे — इसे अपठनीय होना कम संवेदनशील नहीं बनाता है, और घबराहट के क्षण में इसे किसी अजनबी की मरम्मत सेवा पर upload करना बिल्कुल गलत परिस्थितियों में लिया गया निर्णय होता है। अपने स्वयं के डिवाइस पर मरम्मत करने से फ़ाइल वहीं रहती है। CyvoDocOps में, इस तरह के समर्थित ऑपरेशन आपके browser में स्थानीय रूप से चलते हैं और दस्तावेज़ को सर्वर पर upload नहीं किया जाता है।
अक्सर पूछे जाने वाले प्रश्न
मेरा PDF कहता है कि यह क्षतिग्रस्त है जबकि कल ही खुला था?
आमतौर पर फ़ाइल बीच में ट्रंकेट (truncated) हो गई होगी या उसमें बदलाव हुआ होगा — कोई रुका हुआ sync, या खराब transfer। कभी-कभी कुछ भी नहीं बदला होता और आपने बस इसे किसी सख्त reader में खोला होगा। पहले कोई अलग viewer आज़माएँ।
क्या हर दूषित (corrupted) PDF को ठीक किया जा सकता है?
नहीं। यदि index टूट गया है लेकिन सामग्री बची हुई है, तो रिकवरी की संभावना है। यदि बाइट्स वास्तव में गायब हैं, तो उन्हें पुनर्निर्मित नहीं किया जा सकता — कोई भी जो अन्यथा वादा करता है वह अति-वादा कर रहा है।
क्या मेरे पेज खो जाएंगे?
संभवतः। ट्रंकेटेड फ़ाइलें आमतौर पर अपने शुरुआती पेज रखती हैं और अंत के पेज खो देती हैं। मरम्मत के बाद पूरे दस्तावेज़ की जाँच करें, न कि केवल पहले पेज की।
ठीक किया गया फ़ाइल काम करता है लेकिन थोड़ा अलग दिखता है। क्यों?
यदि font या image objects क्षतिग्रस्त थे, तो पुनर्निर्माण (rebuild) फॉन्ट को बदल सकता है या ग्राफिक्स हटा सकता है। पाठ (text) तो बरामद हो जाता है; कुछ प्रस्तुति (presentation) नहीं हो सकती।
क्या मेरी खराब फ़ाइल upload हो गई है?
नहीं। मरम्मत आपके browser में स्थानीय रूप से चलती है और दस्तावेज़ को किसी सर्वर पर नहीं भेजा जाता है।