Le PDF règne. Contrats, rapports, relevés : c'est le format qu'on tend le plus souvent à une IA. Mais attention. Un PDF n'est jamais un simple bloc de texte, et le pseudonymiser correctement suppose d'abord de répondre à une question décisive qui conditionne tout le reste de la méthode : votre fichier contient-il du vrai texte, ou n'est-ce qu'une image scannée ? Tout en découle.
PDF avec texte
Le texte est selectionnable. La detection et le masquage se font directement, la mise en page est conservee.
Masquage directPDF scanne (image)
Le texte est dans l'image. Il faut l'OCR d'abord, puis masquer, sinon l'information reste lisible dans les pixels.
OCR puis masquageLe piege du caviardage
Un rectangle noir sur un nom ? Ça ne suffit pas. Le texte reste là, bien vivant sous la barre, parfaitement copiable, et c'est exactement cette version intacte qui finit par partir dans l'IA sans que personne ne s'en aperçoive. Pseudonymiser, c'est remplacer le contenu, pas le planquer. Plus de détails dans notre article dédié sur pourquoi le caviardage echoue.
La méthode, étape par étape
- Reperez si le PDF est en texte (selectionnable) ou scanne (image).
- Pour un scan, lancez l'OCR pour recuperer le texte.
- Detectez et remplacez les données identifiantes par des pseudonymes.
- Relisez le PDF masque, puis utilisez-le avec l'IA.
- Re-identifiez le resultat en local si besoin.
Safe-Doc fait les deux. PDF texte, PDF scanné en OCR : il détecte, remplace réellement les données identifiantes et restitue un document dont la mise en page reste fidèle à l'original. Tout est expliqué sur la page Anonymiser un PDF avec Safe-Doc.
Testez sur votre PDF. Texte ou scanné, peu importe : vérifiez par vous-même avant d'envoyer le moindre fichier à l'IA.