POSAC · Documentation

Topic Modeling (LDA)

Découvrir automatiquement les sujets latents d'un corpus avec l'Allocation de Dirichlet Latente.

Le Topic Modeling est une méthode statistique non supervisée qui découvre les sujets cachés (topics) d'un corpus, sans qu'on les définisse à l'avance. POSAC implémente l'algorithme LDA (Latent Dirichlet Allocation).

Quels sont les grands sujets abordés dans mon corpus, et comment se répartissent-ils entre les documents ?

L'intuition du LDA

L'idée centrale est que chaque document parle de plusieurs sujets à la fois (dans des proportions variables), et que chaque sujet est un mélange de mots (certains très caractéristiques, d'autres moins).

Un article sur « l'IA en éducation » parlerait à 60 % de pédagogie, 30 % de technologie et 10 % d'éthique. Un autre article traiterait à 80 % de technologie et 20 % d'éthique.

Le LDA découvre ces sujets et ces proportions à partir du texte seul.

Comment ça fonctionne

Le LDA est un modèle génératif bayésien. Il suppose que les textes ont été produits selon ce processus :

  1. Chaque document tire une distribution sur les topics (ex : 60 % topic A, 30 % topic B…)
  2. Pour chaque mot du document, on tire un topic selon cette distribution
  3. On tire le mot selon la distribution de vocabulaire de ce topic

L'algorithme inverse ce processus : à partir des mots observés, il estime les distributions cachées.

Variational Bayes ou Gibbs Sampling

POSAC utilise l'inférence Variational Bayes (scikit-learn), plus rapide que le Gibbs Sampling pour des corpus de taille moyenne. Les résultats peuvent légèrement varier d'une exécution à l'autre : c'est normal.

Paramètres dans POSAC

ParamètreDescriptionConseil
Nombre de topicsCombien de sujets chercherCommencer par 3–5, ajuster selon cohérence
ItérationsNombre de passes d'optimisation50 par défaut — augmenter pour de grands corpus
AlphaConcentration sur les topics par documentFaible = chaque doc se concentre sur peu de topics
BetaConcentration sur les mots par topicFaible = chaque topic a un vocabulaire restreint

Combien de topics ?

Il n'y a pas de nombre « correct ». Lancez l'analyse avec différentes valeurs (3, 5, 7…) et choisissez celle qui produit des topics interprétables et distincts. Des topics qui partagent beaucoup de mots sont un signe de sur-spécification.

Lire les résultats

Les mots-clés de chaque topic

Chaque topic est décrit par ses mots les plus probables (généralement les 10–20 premiers). Leur lecture permet de nommer le topic et de saisir sa cohérence thématique.

La distribution par document

Chaque document reçoit un score par topic (sa proportion estimée). On peut ainsi :

  • identifier les documents qui parlent principalement d'un topic ;
  • voir comment les topics se répartissent dans le corpus.

La cohérence des topics

POSAC calcule un score de cohérence (UMass ou C_v) : plus il est élevé, plus les mots d'un topic ont tendance à co-apparaître dans le corpus — signe de bonne qualité.

LDA vs CHD : quelle différence ?

LDACHD (Reinert)
ParadigmeProbabiliste (mélange flou)Discriminant (classes exclusives)
UnitéDocument entierSegment de ~40 mots (UCE)
RésultatChaque doc = mélange de topicsChaque UCE appartient à une classe
RobustesseStochastique (varie légèrement)Déterministe (même résultat à chaque fois)
Usage SHSGrands corpus, documents longsEntretiens, corpus qualitatifs

Complémentarité

CHD et LDA sont complémentaires : la CHD donne des classes nettes et un dendrogramme interprétatif ; le LDA révèle les mélanges thématiques. Utiliser les deux enrichit l'analyse.

Précautions d'interprétation

  • Le LDA nécessite au minimum quelques dizaines de documents pour produire des topics stables.
  • Les stop-words doivent être soigneusement définis : les mots très fréquents mais peu informatifs parasitent les topics.
  • Un topic est une construction statistique : il appartient au chercheur de lui donner un sens en lisant les documents représentatifs.
  • Le LDA ne tient pas compte de l'ordre des mots dans la phrase (hypothèse bag of words).

On this page