CyvoDocOps
हिन्दी
Dark

अपने PDF में क्या छिपा है: metadata समझाया गया

आप एक नए क्लाइंट को कोटेशन भेजते हैं। दस्तावेज़ साफ़ और पेशेवर दिखता है। लेकिन अगर वे File → Properties खोलते हैं, तो उन्हें उस आखिरी क्लाइंट का नाम दिख सकता है जिसे आपने यह भेजा था, वह टेम्पलेट जो आप सभी के लिए दोबारा इस्तेमाल करते हैं, यह तथ्य कि आपने इसे रात 2:14 बजे एक्सपोर्ट किया था, और एक फ़ाइल पाथ जिसमें आपका पूरा नाम शामिल है। आपने इनमें से कुछ भी टाइप नहीं किया। आपके सॉफ़्टवेयर ने यह आपके लिए जोड़ा, और यह फ़ाइल के साथ चला गया।

metadata वास्तव में क्या है

PDF एक कंटेनर होता है। पृष्ठों के साथ, यह संरचित जानकारी के बारे में ले जाता है। इसका कुछ हिस्सा सचमुच उपयोगी होता है — विंडो बार के लिए एक शीर्षक, स्क्रीन रीडर के लिए भाषा का संकेत। अधिकांश हिस्सा स्वचालित रूप से उस प्रोग्राम द्वारा जोड़ा जाता है जिसने फ़ाइल बनाई है, बिना आपसे पूछे, और यह दस्तावेज़ के जीवनकाल तक वहीं रहता है।

यह कोई दोष नहीं है और न ही यह दुर्भावनापूर्ण है। यह इस बात का एक दुष्प्रभाव है कि दस्तावेज़ उपकरण कैसे काम करते हैं। समस्या बस यह है कि लगभग कोई भी देखता नहीं है, इसलिए डेटा फ़ाइल के साथ उन लोगों तक भेजा जाता है जिन्हें कभी देखना नहीं चाहिए था।

वे तीन जगहें जहाँ यह छिपा होता है

यह वह हिस्सा है जिसे अधिकांश स्पष्टीकरण छोड़ देते हैं, और यही कारण है कि "मैंने लेखक फ़ील्ड साफ़ कर दिया" अक्सर पर्याप्त नहीं होता। PDF metadata कम से कम तीन अलग-अलग परतों में रहता है, और एक को साफ़ करने से अन्य साफ़ नहीं होते।

संक्षेप में: "Author" इसका सार है। एक PDF में तीन अलग-अलग परतों में समान पहचान विवरण हो सकते हैं, और अधिकांश टूल केवल उस एक को साफ़ करते हैं जो आप देख सकते हैं।

वास्तव में क्या लीक होता है (What actually leaks in practice)

वास्तविक दस्तावेज़ों में, बार-बार होने वाले अपराधी नीरस रूप से सुसंगत होते हैं:

उस आखिरी बात पर ज़ोर देना ज़रूरी है, क्योंकि यह सार्वजनिक शर्मिंदगी की पूरी श्रेणी के पीछे का तंत्र है — ऐसे दस्तावेज़ प्रकाशित करना जिनमें संपादन थे जिन्हें वास्तव में हटाया नहीं गया था, बल्कि केवल बदल दिया गया था।

अपनी फ़ाइल में क्या है, यह कैसे देखें

अनुमान न लगाएं। देखें। आप इसे कहीं भी भेजे बिना एक PDF के metadata का निरीक्षण कर सकते हैं:

  1. metadata ऑडिट टूल खोलें। Metadata Audit पर जाएँ। यह आपके browser में चलता है — दस्तावेज़ को विश्लेषण के लिए upload करने के बजाय आपके डिवाइस पर पढ़ा जाता है।
  2. वह PDF चुनें जिसे आप भेजने वाले हैं। आदर्श रूप से बिल्कुल वही फ़ाइल, न कि कोई पुराना ड्राफ्ट — वे फ़ील्ड जिनकी आपको परवाह है, उन्हें एक्सपोर्ट समय पर लिखा जाता है।
  3. रिपोर्ट पढ़ें। किसी भी ऐसी चीज़ की तलाश करें जो आप प्राप्तकर्ता के सामने ज़ोर से नहीं कहेंगे: कोई व्यक्तिगत नाम, कोई पाथ (path), कोई पिछला क्लाइंट, या कोई टाइमस्टैम्प जो आपकी कहानी का खंडन करता हो।
  4. तय करें कि क्या मायने रखता है। एक शीर्षक हानिरहित होता है। आपका होम डायरेक्टरी नहीं।

metadata ऑडिट टूल खोलें

इसे कैसे हटाएँ

एक बार जब आप जान जाते हैं कि क्या मौजूद है, तो इसे हटाना आसान है:

  1. 'metadata हटाएं' टूल खोलें। metadata हटाएं पर जाएँ।
  2. तैयार PDF लोड करें। यह करें अंतिम, हर दूसरे संपादन के बाद। कोई भी टूल जो इसके बाद फ़ाइल को फिर से लिखता है, वह ताज़ा metadata वापस लगा देगा।
  3. साफ़ कॉपी एक्सपोर्ट करें। आपको एक नई फ़ाइल मिलेगी जिसमें पहचान संबंधी फ़ील्ड साफ़ होंगे।
  4. जाँच करें। साफ़ की गई फ़ाइल को वापस metadata ऑडिट से गुज़ारें। रिपोर्ट पर भरोसा करें, इरादे पर नहीं।

metadata हटाने का टूल खोलें

metadata हटाने से क्या होता है नहीं करना

यहीं पर लोग सुरक्षा का झूठा एहसास कर लेते हैं, इसलिए सीमाओं के बारे में स्पष्ट होना ज़रूरी है।

यह वास्तव में कब मायने रखता है

हर दस्तावेज़ को sanitising की ज़रूरत नहीं होती, और ऐसा न मानकर दिखावा करना बस शोर मचाना है। एक मेनू या न्यूज़लेटर के लिए, metadata अप्रासंगिक होता है। यह तब मायने रखना शुरू करता है जब कोई दस्तावेज़ उन लोगों के बीच सीमा पार करता है जिनके पास सभी जानकारी साझा नहीं होती:

एक उचित आदत: किसी भी चीज़ का ऑडिट करें जो आपके संगठन से बाहर जाती है, कुछ भी जो प्रकाशित होता है उसे हटा दें (strip), और बाकी के लिए ज़्यादा चिंता न करें।

यह अपने डिवाइस पर क्यों करना चाहिए?

यह एक स्पष्ट विडंबना है कि किसी गोपनीय दस्तावेज़ को यह पता लगाने के लिए कि इसमें कौन सी गोपनीय जानकारी है, किसी अजनबी के सर्वर पर upload किया जाए। यदि आप जाँच इसलिए कर रहे हैं क्योंकि फ़ाइल संवेदनशील है, तो इसका मतलब है कि पूरी प्रति किसी तीसरे पक्ष को सौंप देना — चाहे वे कोई भी रिटेंशन और लॉगिंग का अभ्यास करते हों — रिपोर्ट पढ़ने से पहले ही बात मान चुका होता है। जहाँ यह पहले से मौजूद है, वहाँ फ़ाइल का निरीक्षण और उसे साफ़ करना उस व्यापार से पूरी तरह बचाता है। CyvoDocOps में, इस प्रकार के समर्थित ऑपरेशन आपके browser में स्थानीय रूप से चलते हैं और दस्तावेज़ को सर्वर पर upload नहीं किया जाता है।

अक्सर पूछे जाने वाले प्रश्न

क्या metadata हटाने से मेरे PDF का रूप बदल जाएगा?

नहीं। दिखाई देने वाले पन्ने अप्रभावित रहते हैं। आप दस्तावेज़ के बारे में संग्रहीत जानकारी को साफ़ कर रहे हैं, न कि दस्तावेज़ की सामग्री को।

क्या मैं किसी और द्वारा भेजे गए PDF से metadata हटा सकता हूँ?

हाँ, यदि आप फ़ाइल खोल सकते हैं। इसे साफ़ करने से आपकी प्रति बदल जाएगी — इसका मूल पर कोई प्रभाव नहीं पड़ता जो भेजने वाले के पास अभी भी है।

लेखक (author) का क्षेत्र ऐसा नाम क्यों दिखाता है जो मैंने कभी नहीं सुना?

यह लगभग हमेशा एक पुन: उपयोग किया गया टेम्पलेट या एक साझा मशीन होती है: यह फ़ील्ड उस व्यक्ति से विरासत में मिला था जिसने मूल दस्तावेज़ बनाया था और इसे कभी अपडेट नहीं किया गया।

क्या metadata डिजिटल सिग्नेचर के समान है?

नहीं। metadata फ़ाइल के बारे में वर्णनात्मक जानकारी होती है। एक सिग्नेचर इसकी अखंडता और मूल स्थान के बारे में एक क्रिप्टोग्राफ़िक दावा होता है। हस्ताक्षरित दस्तावेज़ से metadata हटाने पर सिग्नेचर अमान्य हो सकता है — पहले साफ़ करें, फिर हस्ताक्षर करें।

क्या मेरी फ़ाइलें जाँचने के लिए upload की जाती हैं?

नहीं। इन टूल्स के लिए PDF को आपके browser में स्थानीय रूप से प्रोसेस किया जाता है और इसे किसी सर्वर पर नहीं भेजा जाता है।

संबंधित गाइड और टूल्स