POSAC · Documentation

Stop-words

Gérer les mots vides pour affiner vos analyses lexicales

Stop-words

Les stop-words (ou mots vides) sont des mots très fréquents qui n'apportent pas de valeur sémantique dans une analyse lexicale : articles, prépositions, pronoms, auxiliaires…

Pourquoi gérer les stop-words ?

Sans filtrage, les mots les plus fréquents d'un corpus sont toujours les mots grammaticaux : « le », « de », « et »… Ils dominent les fréquences et masquent le vocabulaire thématique significatif.

En retirant ces mots, on fait émerger le vocabulaire porteur de sens qui caractérise véritablement votre corpus.

Liste par défaut

POSAC fournit des listes de stop-words par langue (français, anglais, espagnol…). Ces listes incluent :

  • Articles définis et indéfinis (le, la, les, un, une)
  • Prépositions (de, du, à, en, par, pour…)
  • Pronoms personnels (je, tu, il, nous…)
  • Auxiliaires (être, avoir, aller…)
  • Conjonctions et adverbes courants

Personnalisation

Vous pouvez ajouter des mots vides spécifiques à votre corpus :

  • Des termes très fréquents mais non informatifs dans votre contexte (ex. : « chercheur », « entretien » dans un corpus d'entretiens)
  • Des mots techniques récurrents qui parasitent les analyses (ex. : noms de l'organisation étudiée)

Vous pouvez aussi supprimer des mots de la liste par défaut si votre recherche porte précisément sur ces mots (ex. : étude des pronoms de politesse).

Impact sur les analyses

Le filtrage des stop-words affecte :

  • Les fréquences et graphiques associés
  • Les nuages de mots
  • La similitude (les cooccurrences sont calculées sur le vocabulaire filtré)
  • La CHD et l'AFC

⚠️ Les stop-words sont appliqués au moment de l'analyse, pas au texte lui-même. Le document original reste intact.

On this page