Ce qui est caché dans votre PDF : comprendre les métadonnées
Vous envoyez un devis à un nouveau client. Le document semble propre et professionnel. Mais s'il ouvre Fichier → Propriétés, il pourrait voir le nom du dernier client auquel vous l'avez envoyé, le modèle que vous réutilisez pour tout le monde, le fait que vous l'ayez exporté à 2 h 14, et un chemin de fichier contenant votre nom complet. Vous n'avez rien tapé de tout cela. Votre logiciel l'a ajouté pour vous, et c'est parti avec le fichier.
De quoi sont réellement les métadonnées
Un PDF est un conteneur. En plus des pages que vous voyez, il transporte des informations structurées à propos du document. Certaines sont vraiment utiles — un titre pour la barre de fenêtre, une indication linguistique pour les lecteurs d'écran. La plupart sont ajoutées automatiquement par le programme qui a produit le fichier, sans vous demander, et elles y restent toute la durée de vie du document.
Ce n'est pas un défaut ni quelque chose de malveillant. C'est une conséquence du fonctionnement des outils de documents. Le problème est simplement que personne ne regarde jamais, et donc les données sont envoyées avec le fichier à des personnes qui n'étaient jamais censées les voir.
Les trois endroits où elles se cachent
Ceci est la partie que la plupart des explications omettent, et c'est pourquoi « J'ai effacé le champ auteur » n'est souvent pas suffisant. Les métadonnées PDF résident dans au moins trois couches distinctes, et vider l'une ne vide pas les autres.
- 1. Le dictionnaire des informations du document. L'ensemble classique de champs :
Title,Author,Subject,Keywords,Creator,Producer,CreationDate,ModDate. C'est ce que votre lecteur PDF affiche sous Propriétés. C'est la couche dont les gens parlent. - 2. Métadonnées XMP. Un paquet XML séparé intégré au fichier, provenant de la Plateforme de métadonnées extensible d'Adobe. Il duplique fréquemment les champs d'informations du document — ce qui signifie qu'un outil qui efface l'un et non l'autre laisse votre nom dans le fichier à un endroit que la boîte de dialogue Propriétés ne montre pas. XMP peut également contenir l'historique des modifications, les déclarations de droits et des enregistrements spécifiques à l'application.
- 3. Métadonnées dans les images intégrées. Si votre PDF contient des photos ou des scans, chaque image intégrée peut contenir son propre bloc EXIF : modèle d'appareil photo ou de téléphone, horodatage de capture et — pour les photos prises avec la localisation activée — coordonnées GPS. Supprimer les champs propres au PDF ne fait rien aux données EXIF contenues dans un JPEG trois couches plus bas.
Ce qui fuit réellement en pratique
Dans les documents réels, les coupables récurrents sont d'un ennui constant :
- Votre nom ou celui d'une autre personne. Le
Authorchamp hérite généralement du compte qui a installé le logiciel — souvent un nom personnel sur un document censé provenir d'une entreprise. Lorsque vous réutilisez un modèle, il peut conserver les coordonnées d'un client précédent. précédent client. - Votre logiciel et sa version.
Creatorenregistre l'application d'origine;Producerenregistre la bibliothèque qui a réellement écrit le PDF. Ensemble, ils annoncent votre chaîne d'outils, ce qui est mineur en soi mais vraiment utile à quelqu'un qui recherche des vulnérabilités connues. - Chemins de fichiers. Certains exportateurs écrivent le chemin source dans le fichier.
/Users/firstname.lastname/Clients/Acme/Drafts/divulgue votre vrai nom, la structure de vos dossiers et parfois votre liste de clients, le tout à partir d'un seul champ. - Horodatages.
CreationDateetModDateenregistrent la date de création et la dernière modification du document. C'est gênant lorsqu'un document était censé être terminé la semaine dernière, ou lorsqu'il montre que vous avez rédigé une lettre de démission pendant les heures de travail de l'entreprise. - Versions antérieures du document. Le format PDF prend en charge les mises à jour incrémentielles : des modifications peuvent être ajoutées à un fichier tout en conservant le contenu précédent dans les octets ci-dessus. Un document édité et res enregistré peut toujours contenir ce qu'il disait auparavant.
Ce dernier mérite d'être souligné, car il est au cœur d'une catégorie entière d'embarras publics — des documents publiés avec des modifications qui n'ont jamais vraiment été supprimées, mais seulement remplacées.
Comment voir ce qu'il y a dans votre propre fichier
Ne devinez pas. Vérifiez. Vous pouvez inspecter les métadonnées d'un PDF sans l'envoyer nulle part :
- Ouvrez l'outil d'audit des métadonnées. Rendez-vous sur Audit des métadonnées. Il fonctionne dans votre navigateur — le document est lu sur votre appareil plutôt que téléversé pour analyse.
- Choisissez le PDF que vous êtes sur le point d'envoyer. Idéalement, le fichier exact, et non un brouillon antérieur — les champs qui vous intéressent sont écrits au moment de l'exportation.
- Lisez le rapport. Cherchez tout ce que vous ne diriez pas à voix haute au destinataire : un nom personnel, un chemin d'accès, un ancien client, un horodatage qui contredit votre histoire.
- Décidez ce qui est important. Un titre n'est pas dangereux. Votre répertoire personnel ne l'est pas non plus.
Ouvrir l'outil d'audit des métadonnées
Comment le supprimer
Une fois que vous savez ce qu'il y a, la suppression est rapide :
- Ouvrez l'outil de suppression des métadonnées. Rendez-vous sur Supprimer les métadonnées.
- Chargez le PDF finalisé. Faites cela en dernier", après chaque autre modification. Tout outil qui réécrit le fichier par la suite appliquera de nouvelles métadonnées.
- Exportez la copie nettoyée. Vous obtiendrez un nouveau fichier avec les champs d'identification effacés.
- Vérifier. Faites passer le fichier nettoyé à nouveau par l'Audit des métadonnées. Fiez-vous au rapport, pas aux intentions.
Ouvrir l'outil de suppression des métadonnées
Ce que le retrait des métadonnées ne fait pas ne faire
C'est ici que les gens se font une fausse impression de sécurité, il est donc utile d'être franc sur les limites.
- Cela ne masque rien de ce que vous pouvez voir. La suppression des métadonnées touche aux données concernant le document, pas au document lui-même. Le texte sensible de la page 3 est toujours sur la page 3.
- Cela ne corrige pas un bloc noir dessiné par-dessus du texte. Un rectangle tracé au-dessus des mots est un graphique qui se trouve au-dessus ; le texte en dessous reste sélectionnable, copiable, toujours là. La suppression des métadonnées ne change rien à cela. Une véritable censure doit supprimer le contenu lui-même, pas simplement le couvrir.
- Cela n'anonymise pas l'écriture. Votre en-tête, votre formulation et le nom du client dans le premier paragraphe sont toujours les vôtres.
- Ce n'est pas permanent à l'avenir. L'outil suivant qui touche le fichier écrit son propre
Produceret un nouveau. Nettoyez la dernière, puis envoyez.ModDate
Quand cela est réellement important
Tous les documents n'ont pas besoin d'être assainis, et prétendre le contraire ne fait que du bruit. Pour un menu ou une newsletter, les métadonnées sont sans importance. Cela devient pertinent lorsqu'un document franchit une frontière entre des personnes qui ne partagent pas toutes les mêmes informations :
- Tout ce qui est envoyé au monde d'un concurrent — propositions, appels d'offres, devis. Les modèles réutilisés fuient les précédents destinataires.
- Tout ce qui est publié. Une fois qu'un fichier est sur un site web, il peut être téléchargé et inspecté par n'importe qui, pour toujours, à son aise.
- Tout ce qui implique des photos ou des scans, en raison de la couche EXIF. Un document scanné photographié à domicile peut contenir les coordonnées de votre maison.
- Tout ce où vous voulez être délibérément anonyme — lanceur d'alerte, rapport sensible, plainte. Ici, le champ
Authorpeut anéantir tout l'effort.
Une habitude raisonnable : auditer tout ce qui quitte votre organisation, supprimer tout ce qui est publié, et ne pas vous inquiéter pour le reste.
Pourquoi faire cela sur votre propre appareil ?
Il y a une ironie manifeste à télécharger un document confidentiel sur le serveur d'un inconnu pour savoir quelles informations confidentielles il contient. Si la raison de votre vérification est que le fichier est sensible, alors remettre une copie complète à un tiers — avec quelle que soit la conservation et la journalisation qu'il pratique — a déjà cédé le point avant même que vous n'ayez lu le rapport. Inspecter et nettoyer le fichier là où il se trouve évite entièrement ce risque. Dans CyvoDocOps, les opérations de ce type sont exécutées localement dans votre navigateur et le document n'est pas téléchargé sur un serveur.
Questions fréquemment posées
Est-ce que la suppression des métadonnées change l'apparence de mon PDF ?
Non. Les pages visibles ne sont pas modifiées. Vous effacez les informations stockées sur le document, et non son contenu.
Puis-je supprimer des métadonnées d'un PDF que quelqu'un d'autre m'a envoyé ?
Oui, si vous pouvez ouvrir le fichier. Le nettoyage modifie votre copie — cela n'a aucun effet sur l'original que l'expéditeur possède toujours.
Pourquoi le champ auteur affiche un nom que je ne connais pas ?
C'est presque toujours un modèle réutilisé ou une machine partagée : le champ a été hérité de celui qui a créé le document original et n'a jamais été mis à jour.
Les métadonnées sont-elles la même chose qu'une signature numérique ?
Non. Les métadonnées sont des informations descriptives sur le fichier. Une signature est une affirmation cryptographique concernant son intégrité et son origine. Retirer les métadonnées d'un document signé peut invalider la signature — nettoyer en premier, signer en dernier.
Mes fichiers sont-ils téléchargés pour vérification ?
Non. Pour ces outils, le PDF est traité localement dans votre navigateur et n'est pas envoyé à un serveur.