Conforme aux standards internationaux (BIPM / NIST) · Exécution 100% locale sans collecte de données
Extraire le texte brut d'un document HTML est une opération courante en développement web, SEO, analyse de données et traitement du langage naturel. Notre outil supprime proprement toutes les balises, scripts et styles pour ne garder que le contenu textuel lisible.
Pourquoi extraire le texte d'un HTML ?
Le code HTML contient des balises structurelles (<div>, <p>, <span>...), des scripts JavaScript, des styles CSS et des entités HTML (&, <, etc.). L'extraction de texte supprime tous ces éléments pour ne conserver que le contenu lisible par un humain. Notre outil décode aussi les entités HTML, retire les scripts et styles, et peut optionnellement conserver ou aplatir les sauts de ligne.
Supprimer les balises ne suffit pas à extraire le texte
L'approche naïve consiste à effacer tout ce qui se trouve entre chevrons. Elle produit un résultat décevant, pour trois raisons distinctes. D'abord, une partie du contenu situé entre les balises n'est pas du texte destiné à la lecture. Le contenu des blocs de script et de style se trouve bien à l'intérieur du document, hors des chevrons : effacer seulement les balises laisse donc le code JavaScript et les règles CSS en plein milieu du résultat. Ces blocs doivent être supprimés entièrement, contenu compris. Ensuite, la structure du document porte de l'information. Les balises ne sont pas décoratives : elles distinguent le contenu de bloc du contenu en ligne. Supprimer un paragraphe fermant sans le remplacer par un saut de ligne colle les phrases les unes aux autres. Une extraction correcte insère des retours à la ligne aux frontières des éléments de bloc — paragraphes, titres, éléments de liste, lignes de tableau — et n'en insère pas pour les éléments en ligne comme les mots en gras ou les liens. Enfin, le HTML est lui-même compact en matière d'espaces. Le navigateur réduit toute suite d'espaces, de tabulations et de retours à la ligne à un espace unique, ce qui permet d'indenter le code source sans conséquence sur l'affichage. Une extraction qui conserve le texte brut restitue toute cette indentation et produit un résultat criblé d'espaces parasites. C'est pourquoi le résultat d'une extraction sérieuse ne ressemble pas au document privé de ses chevrons, mais à ce que vous obtiendriez en sélectionnant la page dans un navigateur et en la copiant.
Les entités HTML et l'espace insécable, deux pièges pour un texte français
Certains caractères ne peuvent pas figurer tels quels dans un document HTML, et sont écrits sous forme d'entités. Une extraction qui ne les décode pas laisse des séquences illisibles au milieu du texte. Les quatre entités fondamentales encodent l'esperluette, les deux chevrons et le guillemet, précisément les caractères qui auraient sinon été interprétés comme du balisage. Une entité non décodée se reconnaît à sa forme : une esperluette, un nom, un point-virgule. Un texte extrait qui contient encore ces séquences n'a été que partiellement traité. Le cas de l'espace insécable mérite une attention particulière en français. La typographie française impose un espace insécable avant les deux-points, le point-virgule, le point d'interrogation et le point d'exclamation, ainsi qu'à l'intérieur des guillemets français. Les rédacteurs et les systèmes de publication en insèrent donc massivement. Or cet espace n'est pas le caractère espace ordinaire : c'est un caractère distinct. Une extraction qui le laisse tel quel produit un texte qui paraît normal à l'œil mais dans lequel une recherche de « mot : » précédé d'un espace ordinaire ne trouvera rien. Les traitements automatiques en aval — découpage en mots, comparaison de chaînes, import dans une base — se comportent alors de façon incompréhensible. La règle : décodez toutes les entités, puis décidez explicitement du sort des espaces insécables. Les conserver préserve la typographie d'origine, ce qui convient à une republication ; les remplacer par des espaces ordinaires facilite tout traitement automatique ultérieur. Le mauvais choix, c'est de ne pas choisir et de laisser un mélange des deux.
Cas d'usage
Analyse SEO
Extrayez le texte visible d'une page pour analyser la densité de mots-clés ou compter les mots.
Nettoyage de données
Nettoyez du HTML copié-collé pour obtenir du texte pur (ex : contenu copié depuis un email HTML).
Accessibilité
Vérifiez que le contenu textuel d'une page est cohérent et lisible sans les balises HTML.
Exemples concrets
| Entrée | Résultat |
|---|---|
| <h1>Titre</h1><p>Texte</p> | Titre\nTexte |
| <script>code</script>Contenu | Contenu |
| & < > | & < > |
Erreurs fréquentes
Supprimer les balises avec une regex simple
Les regex sont fragiles pour parser du HTML. Notre outil utilise un parser DOM approprié.
Oublier de décoder les entités HTML
& doit devenir &, < doit devenir <, etc.
Conseils d'expert
- Utilisez cet outil pour préparer du texte avant une analyse NLP (Natural Language Processing)
- Le contenu des balises <script> et <style> est automatiquement supprimé
- Les sauts de ligne entre les blocs (paragraphes, titres) sont préservés
Questions supplémentaires
Les attributs alt des images sont-ils extraits ?
Est-ce sécurisé pour du HTML inconnu ?
Notez l'outil « Pourquoi extraire le texte d'un HTML ? »