POSAC · Documentation

Spécificités lexicales

Identifier les mots caractéristiques d'un sous-corpus avec le test hypergéométrique de Lafon.

L'analyse des spécificités répond à une question centrale en SHS :

Quels mots caractérisent le discours d'un groupe par rapport aux autres ?

Par exemple : les enseignants du primaire emploient-ils un vocabulaire différent de ceux du supérieur ?

Le principe

On divise le corpus en groupes selon une variable de contexte (niveau, genre, ancienneté…). Pour chaque mot, on compare sa fréquence observée dans un groupe à sa fréquence attendue si le vocabulaire était réparti au hasard.

  • Mot sur-représenté dans un groupe → il le caractérise (spécificité positive)
  • Mot sous-représenté → il en est absent de façon notable (spécificité négative)

Le modèle statistique : la loi hypergéométrique

POSAC propose deux indices au choix :

  • Hypergéométrique (Lafon, 1980) — le test exact de référence en lexicométrie française. Recommandé par défaut.
  • Chi² (χ²) — test du chi-deux sur le tableau 2×2 (forme × groupe), plus classique et utile pour comparer avec d'autres logiciels.

Les deux renvoient un score signé sur la même échelle (±(-log₁₀ p)), donc la lecture « |score| > 2 ≈ significatif » reste valable quel que soit l'indice retenu.

L'idée du test hypergéométrique : on imagine tirer au hasard, dans l'ensemble du corpus, autant de mots qu'en contient le groupe. Quelle est la probabilité d'observer au moins (ou au plus) la fréquence réellement constatée ?

Paramètres du modèle pour une forme dans un groupe :

  • M = nombre total d'occurrences du corpus (population)
  • n = fréquence globale de la forme (succès dans la population)
  • N = nombre d'occurrences du groupe (taille de l'échantillon)
  • k = fréquence de la forme dans le groupe (succès observés)

Lire le score de spécificité

Le résultat est un indice signé :

ScoreInterprétation
> +2Sur-représentation significative (seuil ~1 %)
entre −2 et +2Non significatif
< −2Sous-représentation significative

Plus la valeur absolue est élevée, plus la spécificité est marquée. Le score correspond à −log₁₀(p) affecté du signe de sur/sous-représentation.

Pourquoi pas un simple comptage ?

Un mot peut être plus fréquent dans un groupe simplement parce que ce groupe contient plus de texte. Le test hypergéométrique neutralise cet effet de taille en raisonnant en probabilités.

Conditions d'utilisation

Il faut au moins deux groupes

Les spécificités comparent des groupes entre eux. Si votre variable n'a qu'une seule valeur (tous les documents identiques), aucune spécificité ne peut émerger. Choisissez une variable qui distingue réellement vos textes.

  • Chaque groupe doit contenir assez de texte pour que les fréquences soient stables.
  • Les mots trop rares (fréquence < 3) sont écartés pour éviter le bruit.

Visualisation

POSAC affiche, pour chaque groupe, un diagramme en barres divergentes : les mots sur-représentés s'étendent vers la droite (bleu), les sous-représentés vers la gauche (rouge). On lit ainsi en un coup d'œil le profil lexical de chaque groupe.

Spécificités des catégories grammaticales

Au-delà des mots, POSAC calcule aussi les spécificités des catégories grammaticales (noms, verbes, adjectifs, adverbes…) par groupe. Cela révèle des styles de discours :

  • un groupe sur-représentant les verbes → discours plus narratif, orienté action ;
  • un groupe sur-représentant les adjectifs → discours plus évaluatif, descriptif ;
  • un groupe sur-représentant les noms → discours plus nominal, conceptuel.

Le tableau croisé affiche le score signé de chaque catégorie pour chaque modalité (en gras si significatif).

On this page