अपने PDF में क्या छिपा है: metadata समझाया गया
आप एक नए क्लाइंट को कोटेशन भेजते हैं। दस्तावेज़ साफ़ और पेशेवर दिखता है। लेकिन अगर वे File → Properties खोलते हैं, तो उन्हें उस आखिरी क्लाइंट का नाम दिख सकता है जिसे आपने यह भेजा था, वह टेम्पलेट जो आप सभी के लिए दोबारा इस्तेमाल करते हैं, यह तथ्य कि आपने इसे रात 2:14 बजे एक्सपोर्ट किया था, और एक फ़ाइल पाथ जिसमें आपका पूरा नाम शामिल है। आपने इनमें से कुछ भी टाइप नहीं किया। आपके सॉफ़्टवेयर ने यह आपके लिए जोड़ा, और यह फ़ाइल के साथ चला गया।
metadata वास्तव में क्या है
PDF एक कंटेनर होता है। पृष्ठों के साथ, यह संरचित जानकारी के बारे में ले जाता है। इसका कुछ हिस्सा सचमुच उपयोगी होता है — विंडो बार के लिए एक शीर्षक, स्क्रीन रीडर के लिए भाषा का संकेत। अधिकांश हिस्सा स्वचालित रूप से उस प्रोग्राम द्वारा जोड़ा जाता है जिसने फ़ाइल बनाई है, बिना आपसे पूछे, और यह दस्तावेज़ के जीवनकाल तक वहीं रहता है।
यह कोई दोष नहीं है और न ही यह दुर्भावनापूर्ण है। यह इस बात का एक दुष्प्रभाव है कि दस्तावेज़ उपकरण कैसे काम करते हैं। समस्या बस यह है कि लगभग कोई भी देखता नहीं है, इसलिए डेटा फ़ाइल के साथ उन लोगों तक भेजा जाता है जिन्हें कभी देखना नहीं चाहिए था।
वे तीन जगहें जहाँ यह छिपा होता है
यह वह हिस्सा है जिसे अधिकांश स्पष्टीकरण छोड़ देते हैं, और यही कारण है कि "मैंने लेखक फ़ील्ड साफ़ कर दिया" अक्सर पर्याप्त नहीं होता। PDF metadata कम से कम तीन अलग-अलग परतों में रहता है, और एक को साफ़ करने से अन्य साफ़ नहीं होते।
- 1. दस्तावेज़ जानकारी शब्दकोश (document information dictionary)। क्लासिक फ़ील्ड का सेट:
Title,Author,Subject,Keywords,Creator,Producer,CreationDate,ModDate। यह वह है जो आपका PDF reader Properties के तहत दिखाता है। यह वह परत है जिसके बारे में लोग जानते हैं। - 2. XMP metadata। फ़ाइल में एम्बेडेड, Adobe की Extensible Metadata Platform से एक अलग XML पैकेट। यह अक्सर दस्तावेज़ जानकारी फ़ील्ड को डुप्लिकेट करता है — जिसका मतलब है कि एक ऐसा टूल जो एक को साफ़ करता है और दूसरे को नहीं, वह आपके नाम को फ़ाइल में ऐसी जगह पर छोड़ देता है जहाँ Properties डायलॉग नहीं दिखाता। XMP संपादन इतिहास, अधिकार विवरण और एप्लिकेशन-विशिष्ट रिकॉर्ड भी ले जा सकता है।
- 3. एम्बेडेड छवियों के अंदर metadata। यदि आपके PDF में तस्वीरें या scan हैं, तो प्रत्येक एम्बेडेड छवि अपना EXIF ब्लॉक ले जा सकती है: कैमरा या फ़ोन मॉडल, कैप्चर टाइमस्टैम्प, और — स्थान सेवाओं को सक्षम करके ली गई तस्वीरों पर — GPS निर्देशांक। PDF के अपने फ़ील्ड्स को हटाने से JPEG के अंदर तीन परत नीचे रखे गए EXIF को कोई फर्क नहीं पड़ता।
वास्तव में क्या लीक होता है (What actually leaks in practice)
वास्तविक दस्तावेज़ों में, बार-बार होने वाले अपराधी नीरस रूप से सुसंगत होते हैं:
- आपका नाम, या किसी और का।
Authorफ़ील्ड आमतौर पर उस खाते से विरासत में मिलता है जिसने सॉफ़्टवेयर स्थापित किया था — अक्सर एक कंपनी के दस्तावेज़ पर व्यक्तिगत नाम होता है। जब कोई टेम्पलेट पुन: उपयोग किया जाता है, तो यह पिछले क्लाइंट का विवरण ले जा सकता है। - आपका सॉफ़्टवेयर और उसका संस्करण।
Creatorमूल एप्लिकेशन को रिकॉर्ड करता है;Producerलाइब्रेरी को रिकॉर्ड करता है जिसने वास्तव में PDF लिखा। ये दोनों मिलकर आपके टूलचेन का विज्ञापन करते हैं, जो अपने आप में मामूली है और किसी ऐसे व्यक्ति के लिए सचमुच उपयोगी है जो ज्ञात कमजोरियों की तलाश कर रहा हो। - फ़ाइल पाथ। कुछ एक्सपोर्टर स्रोत पथ को फ़ाइल में लिख देते हैं।
/Users/firstname.lastname/Clients/Acme/Drafts/से आपका असली नाम, आपकी फ़ोल्डर संरचना और कभी-कभी आपकी ग्राहक सूची उजागर हो सकती है, यह सब एक ही फ़ील्ड से। - टाइमस्टैम्प।
CreationDateऔरModDateरिकॉर्ड करते हैं कि दस्तावेज़ कब बनाया गया था और आखिरी बार कब छुआ गया था। यह अजीब होता है जब कोई दस्तावेज़ कथित तौर पर पिछले हफ़्ते पूरा हुआ हो, या जब यह दिखाता है कि आपने कंपनी के समय में इस्तीफे का पत्र ड्राफ्ट किया था। - दस्तावेज़ के पुराने संस्करण। PDF फ़ॉर्मेट वृद्धिशील अपडेट (incremental updates) को सपोर्ट करता है: बदलाव एक फ़ाइल में जोड़े जा सकते हैं जबकि पिछला कंटेंट ऊपर दिए गए बाइट्स में बना रहता है। संपादित और फिर से सहेजा गया दस्तावेज़ अभी भी वह सामग्री रख सकता है जो उसने पहले कही थी।
उस आखिरी बात पर ज़ोर देना ज़रूरी है, क्योंकि यह सार्वजनिक शर्मिंदगी की पूरी श्रेणी के पीछे का तंत्र है — ऐसे दस्तावेज़ प्रकाशित करना जिनमें संपादन थे जिन्हें वास्तव में हटाया नहीं गया था, बल्कि केवल बदल दिया गया था।
अपनी फ़ाइल में क्या है, यह कैसे देखें
अनुमान न लगाएं। देखें। आप इसे कहीं भी भेजे बिना एक PDF के metadata का निरीक्षण कर सकते हैं:
- metadata ऑडिट टूल खोलें। Metadata Audit पर जाएँ। यह आपके browser में चलता है — दस्तावेज़ को विश्लेषण के लिए upload करने के बजाय आपके डिवाइस पर पढ़ा जाता है।
- वह PDF चुनें जिसे आप भेजने वाले हैं। आदर्श रूप से बिल्कुल वही फ़ाइल, न कि कोई पुराना ड्राफ्ट — वे फ़ील्ड जिनकी आपको परवाह है, उन्हें एक्सपोर्ट समय पर लिखा जाता है।
- रिपोर्ट पढ़ें। किसी भी ऐसी चीज़ की तलाश करें जो आप प्राप्तकर्ता के सामने ज़ोर से नहीं कहेंगे: कोई व्यक्तिगत नाम, कोई पाथ (path), कोई पिछला क्लाइंट, या कोई टाइमस्टैम्प जो आपकी कहानी का खंडन करता हो।
- तय करें कि क्या मायने रखता है। एक शीर्षक हानिरहित होता है। आपका होम डायरेक्टरी नहीं।
इसे कैसे हटाएँ
एक बार जब आप जान जाते हैं कि क्या मौजूद है, तो इसे हटाना आसान है:
- 'metadata हटाएं' टूल खोलें। metadata हटाएं पर जाएँ।
- तैयार PDF लोड करें। यह करें अंतिम, हर दूसरे संपादन के बाद। कोई भी टूल जो इसके बाद फ़ाइल को फिर से लिखता है, वह ताज़ा metadata वापस लगा देगा।
- साफ़ कॉपी एक्सपोर्ट करें। आपको एक नई फ़ाइल मिलेगी जिसमें पहचान संबंधी फ़ील्ड साफ़ होंगे।
- जाँच करें। साफ़ की गई फ़ाइल को वापस metadata ऑडिट से गुज़ारें। रिपोर्ट पर भरोसा करें, इरादे पर नहीं।
metadata हटाने से क्या होता है नहीं करना
यहीं पर लोग सुरक्षा का झूठा एहसास कर लेते हैं, इसलिए सीमाओं के बारे में स्पष्ट होना ज़रूरी है।
- यह वह कुछ भी रेडैक्ट नहीं करता जो आप देख सकते हैं। metadata हटाना दस्तावेज़ के बारे में डेटा को छूता है, न कि दस्तावेज़ को। पेज 3 पर संवेदनशील टेक्स्ट अभी भी पेज 3 पर है।
- यह टेक्स्ट के ऊपर खींचे गए ब्लैक बॉक्स को ठीक नहीं करता। शब्दों के ऊपर खींचा गया एक आयत एक ग्राफ़िक होता है जो उनके ऊपर बैठा होता है; नीचे का टेक्स्ट अभी भी चयन योग्य, कॉपी करने योग्य और मौजूद होता है। metadata हटाने से इसमें कुछ नहीं बदलता। वास्तविक रेडैक्शन को सामग्री को ही हटाना पड़ता है, न कि उसे ढकना।
- यह लेखन को गुमनाम (anonymise) नहीं करता। आपका लेटरहेड, आपकी वाक्यांश शैली और पहले पैराग्राफ में क्लाइंट का नाम अभी भी आपका ही रहेगा।
- आगे के लिए यह स्थायी नहीं होता। अगला टूल जो फ़ाइल को छूएगा वह अपना
Producerऔर एक नयाModDateलिखेगा। पहले साफ़ करें, फिर भेजें।
यह वास्तव में कब मायने रखता है
हर दस्तावेज़ को sanitising की ज़रूरत नहीं होती, और ऐसा न मानकर दिखावा करना बस शोर मचाना है। एक मेनू या न्यूज़लेटर के लिए, metadata अप्रासंगिक होता है। यह तब मायने रखना शुरू करता है जब कोई दस्तावेज़ उन लोगों के बीच सीमा पार करता है जिनके पास सभी जानकारी साझा नहीं होती:
- किसी प्रतियोगी की दुनिया में भेजा गया कुछ भी — प्रस्ताव (proposals), निविदाएं (tenders), उद्धरण (quotes)। पुन: उपयोग किए गए टेम्पलेट पिछले प्राप्तकर्ताओं को लीक कर सकते हैं।
- कुछ भी जो प्रकाशित किया जाता है। एक बार जब कोई फ़ाइल किसी वेबसाइट पर आ जाती है, तो इसे कभी भी, अपनी सुविधानुसार, किसी भी द्वारा डाउनलोड और निरीक्षण किया जा सकता है।
- फोटो या scan से संबंधित कुछ भी, EXIF लेयर के कारण। घर पर खींचा गया एक scan किया हुआ दस्तावेज़ आपके घर के निर्देशांक (coordinates) ले जा सकता है।
- कुछ भी जहाँ आप जानबूझकर गुमनाम हैं — व्हिसलब्लोइंग, संवेदनशील रिपोर्टिंग, कोई शिकायत। यहाँ
Authorफ़ील्ड पूरे प्रयास को विफल कर सकता है।
एक उचित आदत: किसी भी चीज़ का ऑडिट करें जो आपके संगठन से बाहर जाती है, कुछ भी जो प्रकाशित होता है उसे हटा दें (strip), और बाकी के लिए ज़्यादा चिंता न करें।
यह अपने डिवाइस पर क्यों करना चाहिए?
यह एक स्पष्ट विडंबना है कि किसी गोपनीय दस्तावेज़ को यह पता लगाने के लिए कि इसमें कौन सी गोपनीय जानकारी है, किसी अजनबी के सर्वर पर upload किया जाए। यदि आप जाँच इसलिए कर रहे हैं क्योंकि फ़ाइल संवेदनशील है, तो इसका मतलब है कि पूरी प्रति किसी तीसरे पक्ष को सौंप देना — चाहे वे कोई भी रिटेंशन और लॉगिंग का अभ्यास करते हों — रिपोर्ट पढ़ने से पहले ही बात मान चुका होता है। जहाँ यह पहले से मौजूद है, वहाँ फ़ाइल का निरीक्षण और उसे साफ़ करना उस व्यापार से पूरी तरह बचाता है। CyvoDocOps में, इस प्रकार के समर्थित ऑपरेशन आपके browser में स्थानीय रूप से चलते हैं और दस्तावेज़ को सर्वर पर upload नहीं किया जाता है।
अक्सर पूछे जाने वाले प्रश्न
क्या metadata हटाने से मेरे PDF का रूप बदल जाएगा?
नहीं। दिखाई देने वाले पन्ने अप्रभावित रहते हैं। आप दस्तावेज़ के बारे में संग्रहीत जानकारी को साफ़ कर रहे हैं, न कि दस्तावेज़ की सामग्री को।
क्या मैं किसी और द्वारा भेजे गए PDF से metadata हटा सकता हूँ?
हाँ, यदि आप फ़ाइल खोल सकते हैं। इसे साफ़ करने से आपकी प्रति बदल जाएगी — इसका मूल पर कोई प्रभाव नहीं पड़ता जो भेजने वाले के पास अभी भी है।
लेखक (author) का क्षेत्र ऐसा नाम क्यों दिखाता है जो मैंने कभी नहीं सुना?
यह लगभग हमेशा एक पुन: उपयोग किया गया टेम्पलेट या एक साझा मशीन होती है: यह फ़ील्ड उस व्यक्ति से विरासत में मिला था जिसने मूल दस्तावेज़ बनाया था और इसे कभी अपडेट नहीं किया गया।
क्या metadata डिजिटल सिग्नेचर के समान है?
नहीं। metadata फ़ाइल के बारे में वर्णनात्मक जानकारी होती है। एक सिग्नेचर इसकी अखंडता और मूल स्थान के बारे में एक क्रिप्टोग्राफ़िक दावा होता है। हस्ताक्षरित दस्तावेज़ से metadata हटाने पर सिग्नेचर अमान्य हो सकता है — पहले साफ़ करें, फिर हस्ताक्षर करें।
क्या मेरी फ़ाइलें जाँचने के लिए upload की जाती हैं?
नहीं। इन टूल्स के लिए PDF को आपके browser में स्थानीय रूप से प्रोसेस किया जाता है और इसे किसी सर्वर पर नहीं भेजा जाता है।