ParseJet

Transformer du HTML en fichier texte

Collez une URL ou téléversez un fichier .html et obtenez un texte brut débarrassé de chaque balise, script et feuille de style. ParseJet décode les entités HTML, respecte l'ordre de lecture et renvoie un texte réellement exploitable — gratuit, sans inscription.

Déposez un fichier ici ou parcourir

Accepte les fichiers HTML,HTM

Gratuit — 3 requêtes/jour, pas d'inscription. pour 300 crédits/mois gratuits.

Comment ça marche

1

Téléversez du HTML ou collez une URL

Déposez un fichier .html ci-dessus, ou collez l'URL d'une page en ligne — les deux chemins produisent le même texte propre.

2

Balises supprimées, texte conservé

ParseJet analyse le balisage, retire balises, scripts, styles et commentaires, et décode les entités comme & et   en vrais caractères.

3

Copiez votre texte

Copiez le texte brut pour l'indexation, le NLP ou la lecture — ou appelez l'API pour transformer du HTML en texte dans votre propre pipeline.

Fonctionnalités clés

Ce qui distingue ce html to text.

Suppression complète des balises

Chaque balise HTML disparaît — scripts, styles en ligne, pixels de suivi et commentaires compris. Seul le texte lisible par un humain subsiste.

Entités décodées

&,  , —, ’ et toutes les autres entités sont décodées en vrais caractères. La sortie est toujours en UTF-8 propre.

Ordre de lecture respecté

Le texte ressort dans l'ordre où une personne le lirait — pas dans l'ordre du code source, brouillé par les div de mise en page.

Le HTML mal formé passe aussi

Balises non fermées, balisage hérité imbriqué, styles en ligne : le HTML du monde réel est analysé sans casser la sortie.

Fichier ou URL en entrée

Convertissez des fichiers .html enregistrés ou récupérez une page en ligne par son URL — la même API gère les deux.

Markdown si vous préférez

Besoin de structure plutôt que de texte plat ? Le même endpoint renvoie du Markdown avec titres et listes — omettez simplement output_format=raw.

Cas d'utilisation

Scénarios courants où cet outil vous fait gagner du temps.

Indexation et NLP

Alimentez moteurs de recherche et modèles NLP avec le contenu textuel des pages — sans que le balisage ne gonfle l'index.

Prétraitement pour les LLM

Le HTML brut gaspille des tokens en balises. Réduisez-le d'abord en texte brut et faites tenir bien plus de contenu réel dans un prompt.

E-mails et newsletters

Extrayez le texte lisible des e-mails HTML et des newsletters pour l'archivage, la citation ou les versions en texte brut.

Sortie d'un pipeline de scraping

Transformez le HTML collecté par votre crawler en texte propre pour le stockage et l'analyse — un appel d'API par document.

Automatiser avec l'API

Utilisez le même outil de manière programmatique. Fonctionne avec n'importe quel langage — juste du HTTP.

cURL
# Convert an HTML file to plain text
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Convert a live page by URL
curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/page"}'
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    params={"output_format": "raw"},
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("page.html", "rb")},
)
print(resp.json()["text"])  # plain text, tags stripped
JavaScript
const formData = new FormData();
formData.append("file", htmlFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
  {
    method: "POST",
    headers: { Authorization: "Bearer YOUR_API_KEY" },
    body: formData,
  }
);
const { text } = await res.json(); // plain text

Vous voulez automatiser cela ?

L'API ParseJet vous offre la même puissance d'analyse via un seul point de terminaison HTTP. Pas de ffmpeg, poppler ou tesseract — juste un appel API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Lire la documentation API

Questions fréquentes

Comment transformer un fichier HTML en texte ?

Téléversez un fichier .html ou collez une URL ci-dessus : ParseJet supprime tout le balisage et renvoie le texte lisible. Pour automatiser, envoyez un POST sur /v1/parse/auto/file avec output_format=raw.

Les scripts et le CSS sont-ils supprimés aussi ?

Oui. JavaScript, blocs de style, styles en ligne, commentaires HTML et code de suivi sont tous retirés — rien de tout cela ne se retrouve dans le texte de sortie.

Que deviennent les entités HTML comme & et   ?

Elles sont décodées en vrais caractères (&, espace, tirets cadratins, apostrophes courbes, etc.), pour un texte qui se lit normalement, sans balisage échappé.

Puis-je convertir une page en ligne plutôt qu'un fichier ?

Oui. Collez l'URL de la page dans l'outil, ou envoyez-la en POST sur /v1/parse/webpage — ParseJet récupère la page et en extrait le contenu principal sous forme de texte.

Et si je veux du Markdown plutôt que du texte plat ?

Utilisez le même endpoint sans output_format=raw : ParseJet renvoie du Markdown avec titres, listes, tableaux et liens conservés. Voir notre outil HTML vers Markdown.

Est-ce gratuit ?

Oui. Vous disposez de 3 conversions gratuites par jour sans inscription, et un compte API gratuit inclut 300 crédits par mois. Les forfaits payants démarrent à 19 $/mois.

Commencez à extraire du texte gratuitement

Aucune inscription requise. Analysez votre premier fichier en quelques secondes.

Voir les tarifs