Topic Modeling (LDA)
Découvrir automatiquement les sujets latents d'un corpus avec l'Allocation de Dirichlet Latente.
Le Topic Modeling est une méthode statistique non supervisée qui découvre les sujets cachés (topics) d'un corpus, sans qu'on les définisse à l'avance. POSAC implémente l'algorithme LDA (Latent Dirichlet Allocation).
Quels sont les grands sujets abordés dans mon corpus, et comment se répartissent-ils entre les documents ?
L'intuition du LDA
L'idée centrale est que chaque document parle de plusieurs sujets à la fois (dans des proportions variables), et que chaque sujet est un mélange de mots (certains très caractéristiques, d'autres moins).
Un article sur « l'IA en éducation » parlerait à 60 % de pédagogie, 30 % de technologie et 10 % d'éthique. Un autre article traiterait à 80 % de technologie et 20 % d'éthique.
Le LDA découvre ces sujets et ces proportions à partir du texte seul.
Comment ça fonctionne
Le LDA est un modèle génératif bayésien. Il suppose que les textes ont été produits selon ce processus :
- Chaque document tire une distribution sur les topics (ex : 60 % topic A, 30 % topic B…)
- Pour chaque mot du document, on tire un topic selon cette distribution
- On tire le mot selon la distribution de vocabulaire de ce topic
L'algorithme inverse ce processus : à partir des mots observés, il estime les distributions cachées.
Variational Bayes ou Gibbs Sampling
POSAC utilise l'inférence Variational Bayes (scikit-learn), plus rapide que le Gibbs Sampling pour des corpus de taille moyenne. Les résultats peuvent légèrement varier d'une exécution à l'autre : c'est normal.
Paramètres dans POSAC
| Paramètre | Description | Conseil |
|---|---|---|
| Nombre de topics | Combien de sujets chercher | Commencer par 3–5, ajuster selon cohérence |
| Itérations | Nombre de passes d'optimisation | 50 par défaut — augmenter pour de grands corpus |
| Alpha | Concentration sur les topics par document | Faible = chaque doc se concentre sur peu de topics |
| Beta | Concentration sur les mots par topic | Faible = chaque topic a un vocabulaire restreint |
Combien de topics ?
Il n'y a pas de nombre « correct ». Lancez l'analyse avec différentes valeurs (3, 5, 7…) et choisissez celle qui produit des topics interprétables et distincts. Des topics qui partagent beaucoup de mots sont un signe de sur-spécification.
Lire les résultats
Les mots-clés de chaque topic
Chaque topic est décrit par ses mots les plus probables (généralement les 10–20 premiers). Leur lecture permet de nommer le topic et de saisir sa cohérence thématique.
La distribution par document
Chaque document reçoit un score par topic (sa proportion estimée). On peut ainsi :
- identifier les documents qui parlent principalement d'un topic ;
- voir comment les topics se répartissent dans le corpus.
La cohérence des topics
POSAC calcule un score de cohérence (UMass ou C_v) : plus il est élevé, plus les mots d'un topic ont tendance à co-apparaître dans le corpus — signe de bonne qualité.
LDA vs CHD : quelle différence ?
| LDA | CHD (Reinert) | |
|---|---|---|
| Paradigme | Probabiliste (mélange flou) | Discriminant (classes exclusives) |
| Unité | Document entier | Segment de ~40 mots (UCE) |
| Résultat | Chaque doc = mélange de topics | Chaque UCE appartient à une classe |
| Robustesse | Stochastique (varie légèrement) | Déterministe (même résultat à chaque fois) |
| Usage SHS | Grands corpus, documents longs | Entretiens, corpus qualitatifs |
Complémentarité
CHD et LDA sont complémentaires : la CHD donne des classes nettes et un dendrogramme interprétatif ; le LDA révèle les mélanges thématiques. Utiliser les deux enrichit l'analyse.
Précautions d'interprétation
- Le LDA nécessite au minimum quelques dizaines de documents pour produire des topics stables.
- Les stop-words doivent être soigneusement définis : les mots très fréquents mais peu informatifs parasitent les topics.
- Un topic est une construction statistique : il appartient au chercheur de lui donner un sens en lisant les documents représentatifs.
- Le LDA ne tient pas compte de l'ordre des mots dans la phrase (hypothèse bag of words).