Reconnaissance d'entités nommées (NER)
Identifier automatiquement les personnes, lieux, organisations et dates mentionnés dans le corpus.
La Reconnaissance d'Entités Nommées (Named Entity Recognition, NER) est une technique de traitement automatique du langage (TAL) qui identifie et classe automatiquement les noms propres et entités spécifiques dans un texte.
Qui est mentionné ? Où ? Quand ? Par quelle organisation ?
Les types d'entités détectées
| Type | Exemples |
|---|---|
| PER — Personnes | Emmanuel Macron, Marie Curie |
| LOC — Lieux géographiques | Paris, la Bretagne, l'Atlantique |
| ORG — Organisations | CNRS, Université de Toulouse, Apple |
| DATE — Dates et périodes | le 3 mars 2020, l'an dernier, depuis 2010 |
| MISC — Divers | nationalités, événements, œuvres |
Comment ça fonctionne
POSAC utilise spaCy avec les modèles linguistiques fr_core_news_lg (français) et en_core_web_lg (anglais). Ces modèles sont entraînés sur de larges corpus annotés et utilisent un réseau de neurones pour détecter les entités en contexte.
La détection s'appuie sur :
- la forme graphique du mot (majuscule initiale) ;
- le contexte syntaxique (un nom précédé de « M. » est probablement une personne) ;
- la connaissance encyclopédique encodée dans le modèle.
Sensibilité au domaine
Les modèles généraux peuvent manquer des entités très spécialisées (acronymes institutionnels locaux, noms peu fréquents) ou mal classer certaines entités ambiguës. Un post-traitement manuel reste souvent utile.
Lire les résultats dans POSAC
Vue par type
POSAC regroupe les entités par type et affiche pour chacune :
- le nombre total d'occurrences dans le corpus ;
- le nombre de documents où elle apparaît.
Cela permet de repérer les entités structurantes du corpus — celles qui traversent de nombreux documents.
Vue par document
Chaque document est annoté individuellement : on voit quelles entités il mentionne, permettant de comparer les profils d'un document à l'autre.
Usages en SHS
- Corpus d'entretiens : qui sont les acteurs cités spontanément par les enquêtés ?
- Corpus de presse : quels lieux, acteurs, organisations structurent la couverture médiatique ?
- Corpus historiques : cartographier les réseaux d'acteurs sur une période.
- Anonymisation : identifier les entités à masquer avant diffusion (voir outil Anonymisation).
NER ≠ analyse relationnelle
La NER détecte les entités mais ne dit pas comment elles sont reliées. Pour analyser les relations entre acteurs, combinez NER + concordancier (contexte autour de l'entité) ou NER + analyse de cooccurrence.
Précautions
- Casse : le NER est sensible à la majuscule. Les textes très bruités (SMS, transcriptions automatiques non corrigées) donnent de moins bons résultats.
- Entités composées : « Sciences humaines et sociales » peut être reconnu comme une organisation ou non selon le contexte.
- Langue : assurez-vous que la langue du corpus correspond au modèle chargé (paramètre langue du corpus dans POSAC).