ParseJet

Convertitore da HTML a testo

Incolla un URL o carica un file .html e ottieni testo semplice e pulito, con ogni tag, script e stile rimosso. ParseJet decodifica le entità HTML, mantiene l'ordine di lettura e restituisce testo davvero utilizzabile — gratis, senza registrazione.

Trascina un file qui o sfoglia

Accetta file HTML,HTM

Gratuito — 3 richieste/giorno, nessuna registrazione. per 300 crediti/mese gratuiti.

Come funziona

1

Carica l'HTML o incolla un URL

Trascina un file .html qui sopra, oppure incolla l'URL di una pagina online: entrambe le strade producono lo stesso testo pulito.

2

Tag rimossi, testo conservato

ParseJet analizza il markup, rimuove tag, script, stili e commenti, e decodifica entità come & e   in caratteri reali.

3

Copia il testo

Copia il testo semplice per indicizzazione, NLP o lettura — oppure chiama l'API per convertire HTML in testo nella tua pipeline.

Funzionalità principali

Cosa rende questo html to text unico.

Rimozione completa dei tag

Ogni tag HTML sparisce — inclusi script, stili inline, pixel di tracciamento e commenti. Resta solo il testo leggibile da un essere umano.

Decodifica delle entità

&,  , —, ’ e ogni altra entità vengono decodificate nel loro carattere reale. L'output è sempre UTF-8 pulito.

Ordine di lettura preservato

Il testo esce nell'ordine in cui una persona lo leggerebbe — non nell'ordine del sorgente DOM stravolto dai div di layout.

HTML disordinato gestito

Tag non chiusi, markup legacy annidato, stili inline: l'HTML del mondo reale viene analizzato senza rovinare l'output.

Input da file o da URL

Converti file .html salvati o scarica una pagina online tramite URL — la stessa API gestisce entrambi i casi.

Markdown quando ti serve

Preferisci la struttura al testo piatto? Lo stesso endpoint restituisce Markdown con intestazioni ed elenchi — basta omettere output_format=raw.

Casi d'uso

Scenari comuni in cui questo strumento ti fa risparmiare tempo.

Indicizzazione per la ricerca e NLP

Fornisci a motori di ricerca e modelli NLP il contenuto testuale delle pagine — senza rumore di markup a gonfiare l'indice.

Pre-elaborazione dell'input per gli LLM

L'HTML grezzo spreca token in tag. Riduci prima a testo semplice e fai entrare molto più contenuto reale nel prompt.

Testo di email e newsletter

Estrai il testo leggibile da email e newsletter HTML per archiviarlo, citarlo o creare versioni solo testo.

Output di pipeline di scraping

Trasforma l'HTML raccolto dal crawler in testo pulito per archiviazione e analisi — una chiamata API per documento.

Automatizza con l'API

Usa lo stesso strumento in modo programmatico. Funziona con qualsiasi linguaggio — basta HTTP.

cURL
# Convert an HTML file to plain text
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Convert a live page by URL
curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/page"}'
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    params={"output_format": "raw"},
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("page.html", "rb")},
)
print(resp.json()["text"])  # plain text, tags stripped
JavaScript
const formData = new FormData();
formData.append("file", htmlFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
  {
    method: "POST",
    headers: { Authorization: "Bearer YOUR_API_KEY" },
    body: formData,
  }
);
const { text } = await res.json(); // plain text

Vuoi automatizzare questo processo?

L'API ParseJet ti offre la stessa potenza di analisi tramite un singolo endpoint HTTP. Niente ffmpeg, poppler o tesseract — basta una sola chiamata API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Leggi la Documentazione API

Domande frequenti

Come converto HTML in testo semplice?

Carica un file .html o incolla un URL qui sopra: ParseJet rimuove tutto il markup e restituisce il testo leggibile. Per automatizzare, invia una POST a /v1/parse/auto/file con output_format=raw.

Rimuove anche script e CSS?

Sì. JavaScript, blocchi di stile, stili inline, commenti HTML e codice di tracciamento vengono rimossi del tutto — niente di tutto ciò finisce nel testo in output.

Che fine fanno le entità HTML come & e  ?

Vengono decodificate nei caratteri reali (&, uno spazio, trattini lunghi, virgolette tipografiche e così via), quindi l'output si legge come testo normale, non come markup con escape.

Posso convertire una pagina web online invece di un file?

Sì. Incolla l'URL della pagina nello strumento, oppure inviala in POST a /v1/parse/webpage: ParseJet scarica la pagina ed estrae il contenuto principale come testo.

E se voglio Markdown invece di testo piatto?

Usa lo stesso endpoint senza output_format=raw: ParseJet restituisce Markdown con intestazioni, elenchi, tabelle e link preservati. Vedi il nostro strumento da HTML a Markdown.

È gratis?

Sì. Hai 3 conversioni gratuite al giorno senza registrazione, e un account API gratuito include 300 crediti al mese. I piani a pagamento partono da $19/mese.

Inizia a estrarre testo gratuitamente

Nessuna registrazione richiesta. Analizza il tuo primo file in pochi secondi.

Vedi i Prezzi