Anonymisation
Protéger les données personnelles dans vos corpus
Anonymisation
L'anonymisation est une étape éthique et réglementaire (RGPD) qui consiste à supprimer ou remplacer les données permettant d'identifier des personnes physiques dans vos corpus.
Pourquoi anonymiser ?
Les corpus de sciences humaines (entretiens, questionnaires ouverts, réseaux sociaux) contiennent fréquemment des données personnelles :
- Noms de personnes, de lieux (domicile, lieu de travail)
- Noms d'organisations identifiantes
- Dates précises, numéros de téléphone, adresses
Le RGPD impose de traiter ces données avec soin, surtout lorsque les corpus sont partagés ou publiés.
Détection automatique des entités
POSAC utilise un modèle de Reconnaissance d'Entités Nommées (NER) pour détecter automatiquement :
| Type | Exemples |
|---|---|
| PER — Personnes | Pierre Dupont, Marie |
| LOC — Lieux | Paris, Marseille, rue de la Paix |
| ORG — Organisations | INSEE, Université de Toulon |
| MISC — Divers | nationalités, événements nommés |
Flux de travail
- Sélectionnez les documents à analyser
- Lancez la détection automatique
- Révisez les entités proposées : validez ou rejetez chaque suggestion
- Choisissez le mode de remplacement :
[PRÉNOM],[NOM],[LIEU]… (tags typés)[ANONYMISÉ](tag générique)- Pseudonyme aléatoire (
Alice,Bob…)
- Appliquez l'anonymisation au document
La détection automatique n'est pas parfaite : relisez toujours les entités avant d'appliquer.
Bonnes pratiques
- Annotez toujours les entités manuellement après la détection automatique
- Conservez une version non anonymisée dans un espace sécurisé (accès restreint)
- Documentez vos choix d'anonymisation dans le journal analytique du projet
- Traitez les entités MISC avec attention : certaines peuvent être identifiantes dans leur contexte