POSAC · Documentation

Anonymisation

Protéger les données personnelles dans vos corpus

Anonymisation

L'anonymisation est une étape éthique et réglementaire (RGPD) qui consiste à supprimer ou remplacer les données permettant d'identifier des personnes physiques dans vos corpus.

Pourquoi anonymiser ?

Les corpus de sciences humaines (entretiens, questionnaires ouverts, réseaux sociaux) contiennent fréquemment des données personnelles :

  • Noms de personnes, de lieux (domicile, lieu de travail)
  • Noms d'organisations identifiantes
  • Dates précises, numéros de téléphone, adresses

Le RGPD impose de traiter ces données avec soin, surtout lorsque les corpus sont partagés ou publiés.

Détection automatique des entités

POSAC utilise un modèle de Reconnaissance d'Entités Nommées (NER) pour détecter automatiquement :

TypeExemples
PER — PersonnesPierre Dupont, Marie
LOC — LieuxParis, Marseille, rue de la Paix
ORG — OrganisationsINSEE, Université de Toulon
MISC — Diversnationalités, événements nommés

Flux de travail

  1. Sélectionnez les documents à analyser
  2. Lancez la détection automatique
  3. Révisez les entités proposées : validez ou rejetez chaque suggestion
  4. Choisissez le mode de remplacement :
    • [PRÉNOM], [NOM], [LIEU]… (tags typés)
    • [ANONYMISÉ] (tag générique)
    • Pseudonyme aléatoire (Alice, Bob…)
  5. Appliquez l'anonymisation au document

La détection automatique n'est pas parfaite : relisez toujours les entités avant d'appliquer.

Bonnes pratiques

  • Annotez toujours les entités manuellement après la détection automatique
  • Conservez une version non anonymisée dans un espace sécurisé (accès restreint)
  • Documentez vos choix d'anonymisation dans le journal analytique du projet
  • Traitez les entités MISC avec attention : certaines peuvent être identifiantes dans leur contexte

On this page