N-grammes et expressions récurrentes
Identifier les séquences de mots qui co-apparaissent fréquemment dans un corpus.
Un n-gramme est une séquence de n mots consécutifs. Analyser les n-grammes d'un corpus revient à chercher les expressions récurrentes, les formules figées, les collocations caractéristiques.
Au-delà des mots isolés, quelles expressions reviennent régulièrement dans mon corpus ?
Les types de n-grammes
| Type | Exemple | Intérêt |
|---|---|---|
| Bigramme (2-grammes) | intelligence artificielle, données personnelles | Expressions composées très fréquentes |
| Trigramme (3-grammes) | réseau de neurones, droit à l'oubli | Locutions figées, formules |
| 4-grammes | traitement automatique du langage | Syntagmes terminologiques |
Pourquoi c'est utile
Un mot seul perd souvent son sens hors contexte. Le mot gouvernement peut renvoyer à des réalités très différentes selon qu'il est associé à gouvernement numérique, gouvernement des données ou gouvernance des algorithmes.
Les n-grammes révèlent :
- les associations lexicales stables qui structurent le discours ;
- le vocabulaire technique ou jargon propre au domaine étudié ;
- les formules rhétoriques récurrentes (ex. : il faut bien, c'est-à-dire) ;
- les co-occurrences significatives non visibles en lexicométrie simple.
N-grammes ≠ collocations statistiques
Les n-grammes sont comptés par fréquence brute : on observe combien de fois une séquence apparaît. La collocation ajoute un test statistique (PMI, t-score) pour mesurer si la co-apparition est significativement plus fréquente qu'attendue par hasard. POSAC propose les deux approches.
Comment POSAC calcule les n-grammes
- Le corpus est tokenisé et les stop-words sont filtrés (option activable)
- Toutes les séquences de n tokens consécutifs sont extraites
- Les séquences sont comptées et triées par fréquence décroissante
- Les top K séquences sont affichées (K paramétrable, défaut : 40)
Stop-words et n-grammes
Filtrer les stop-words avant le calcul produit des séquences plus significatives (apprentissage machine plutôt que de l'apprentissage), mais peut rater des expressions figées contenant des mots grammaticaux (à la une, en temps réel). Selon votre corpus, testez avec et sans filtrage.
Lire les résultats
Les résultats sont présentés sous forme de barres de fréquence triées. Repérez :
- les n-grammes très fréquents : ils signalent les thèmes centraux du corpus
- les n-grammes inattendus : expressions que vous n'auriez pas anticipées — souvent les découvertes les plus intéressantes
- les n-grammes liés à des artefacts (ex. : sic sic sic) : indices de problèmes de transcription ou de nettoyage à corriger
Utilisations en SHS
- Analyse du discours : identifier les formules, les énoncés types, les arguments récurrents
- Analyse terminologique : extraire le lexique spécialisé d'un domaine
- Comparaison de sous-corpus : les bigrammes caractéristiques d'un groupe vs un autre révèlent des différences d'univers conceptuel
- Construction du codebook : les n-grammes fréquents suggèrent des catégories de codage