POSAC · Documentation

Nettoyage du corpus

Normaliser et homogénéiser les textes avant analyse

Nettoyage du corpus

Le nettoyage est une étape indispensable avant toute analyse quantitative. Des textes bruts contiennent des artefacts (balises HTML, caractères spéciaux, encodages erronés) qui faussent les statistiques lexicales.

Pourquoi nettoyer ?

Un corpus non nettoyé génère du bruit : « éducation », « Éducation » et « education » sont comptés comme trois formes différentes. Le nettoyage :

  • Normalise la casse (minuscules)
  • Supprime la ponctuation et les caractères non textuels
  • Retire les balises HTML/XML restantes
  • Corrige les encodages défaillants (caractères mal convertis)
  • Homogénéise les espaces (doubles espaces, tabulations, retours à la ligne multiples)

Paradigmes de nettoyage

POSAC propose plusieurs niveaux :

ParadigmeUsage
LégerSupprime uniquement les artefacts évidents (balises, encodages). Conserve la ponctuation et la casse originales.
StandardNormalise la casse, supprime la ponctuation non significative. Recommandé pour la plupart des corpus.
AgressifSupprime tout sauf les mots : ponctuation, chiffres, symboles. Utile pour les nuages de mots et fréquences brutes.
AcadémiqueStandard + conservation des apostrophes et tirets composés (utile pour les textes scientifiques).

Nettoyage document par document vs corpus entier

  • Document : prévisualiser l'effet avant d'appliquer en masse
  • Corpus entier : applique le paradigme à tous les documents en une opération

⚠️ Le nettoyage crée une nouvelle version du texte. L'original reste accessible dans l'onglet Versions.

Conseils pratiques

  • Commencez toujours par un nettoyage léger et vérifiez les résultats sur quelques documents
  • Conservez la ponctuation si vous prévoyez une analyse syntaxique (phrases, NER)
  • Pour les corpus d'entretiens, le paradigme standard est généralement suffisant
  • Pour les corpus de presse ou web, préférez agressif ou standard après avoir retiré les balises

On this page