Convertitore da HTML a testo
Incolla un URL o carica un file .html e ottieni testo semplice e pulito, con ogni tag, script e stile rimosso. ParseJet decodifica le entità HTML, mantiene l'ordine di lettura e restituisce testo davvero utilizzabile — gratis, senza registrazione.
Trascina un file qui o sfoglia
Accetta file HTML,HTM
Gratuito — 3 richieste/giorno, nessuna registrazione. per 300 crediti/mese gratuiti.
Come funziona
Carica l'HTML o incolla un URL
Trascina un file .html qui sopra, oppure incolla l'URL di una pagina online: entrambe le strade producono lo stesso testo pulito.
Tag rimossi, testo conservato
ParseJet analizza il markup, rimuove tag, script, stili e commenti, e decodifica entità come & e in caratteri reali.
Copia il testo
Copia il testo semplice per indicizzazione, NLP o lettura — oppure chiama l'API per convertire HTML in testo nella tua pipeline.
Funzionalità principali
Cosa rende questo html to text unico.
Rimozione completa dei tag
Ogni tag HTML sparisce — inclusi script, stili inline, pixel di tracciamento e commenti. Resta solo il testo leggibile da un essere umano.
Decodifica delle entità
&, , —, ’ e ogni altra entità vengono decodificate nel loro carattere reale. L'output è sempre UTF-8 pulito.
Ordine di lettura preservato
Il testo esce nell'ordine in cui una persona lo leggerebbe — non nell'ordine del sorgente DOM stravolto dai div di layout.
HTML disordinato gestito
Tag non chiusi, markup legacy annidato, stili inline: l'HTML del mondo reale viene analizzato senza rovinare l'output.
Input da file o da URL
Converti file .html salvati o scarica una pagina online tramite URL — la stessa API gestisce entrambi i casi.
Markdown quando ti serve
Preferisci la struttura al testo piatto? Lo stesso endpoint restituisce Markdown con intestazioni ed elenchi — basta omettere output_format=raw.
Casi d'uso
Scenari comuni in cui questo strumento ti fa risparmiare tempo.
Indicizzazione per la ricerca e NLP
Fornisci a motori di ricerca e modelli NLP il contenuto testuale delle pagine — senza rumore di markup a gonfiare l'indice.
Pre-elaborazione dell'input per gli LLM
L'HTML grezzo spreca token in tag. Riduci prima a testo semplice e fai entrare molto più contenuto reale nel prompt.
Testo di email e newsletter
Estrai il testo leggibile da email e newsletter HTML per archiviarlo, citarlo o creare versioni solo testo.
Output di pipeline di scraping
Trasforma l'HTML raccolto dal crawler in testo pulito per archiviazione e analisi — una chiamata API per documento.
Automatizza con l'API
Usa lo stesso strumento in modo programmatico. Funziona con qualsiasi linguaggio — basta HTTP.
# Convert an HTML file to plain text curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Convert a live page by URL curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"url": "https://example.com/page"}'
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
params={"output_format": "raw"},
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("page.html", "rb")},
)
print(resp.json()["text"]) # plain text, tags stripped const formData = new FormData();
formData.append("file", htmlFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
{
method: "POST",
headers: { Authorization: "Bearer YOUR_API_KEY" },
body: formData,
}
);
const { text } = await res.json(); // plain text Vuoi automatizzare questo processo?
L'API ParseJet ti offre la stessa potenza di analisi tramite un singolo endpoint HTTP. Niente ffmpeg, poppler o tesseract — basta una sola chiamata API.
Domande frequenti
Come converto HTML in testo semplice?
Carica un file .html o incolla un URL qui sopra: ParseJet rimuove tutto il markup e restituisce il testo leggibile. Per automatizzare, invia una POST a /v1/parse/auto/file con output_format=raw.
Rimuove anche script e CSS?
Sì. JavaScript, blocchi di stile, stili inline, commenti HTML e codice di tracciamento vengono rimossi del tutto — niente di tutto ciò finisce nel testo in output.
Che fine fanno le entità HTML come & e ?
Vengono decodificate nei caratteri reali (&, uno spazio, trattini lunghi, virgolette tipografiche e così via), quindi l'output si legge come testo normale, non come markup con escape.
Posso convertire una pagina web online invece di un file?
Sì. Incolla l'URL della pagina nello strumento, oppure inviala in POST a /v1/parse/webpage: ParseJet scarica la pagina ed estrae il contenuto principale come testo.
E se voglio Markdown invece di testo piatto?
Usa lo stesso endpoint senza output_format=raw: ParseJet restituisce Markdown con intestazioni, elenchi, tabelle e link preservati. Vedi il nostro strumento da HTML a Markdown.
È gratis?
Sì. Hai 3 conversioni gratuite al giorno senza registrazione, e un account API gratuito include 300 crediti al mese. I piani a pagamento partono da $19/mese.
Strumenti correlati
HTML to Markdown Converter
Convert HTML to Markdown online for free. Upload an HTML file or paste a URL — get clean Markdown with headings, lists, tables, and links preserved.
URL to Markdown Converter
Convert any URL to clean Markdown online for free. Paste a link and get the page's main content as Markdown — no ads, no navigation. API available.
PDF to Text Converter
Convert PDF to plain text online for free. Handles multi-page documents, scanned PDFs with OCR, and complex layouts. No signup — or automate via API.
Inizia a estrarre testo gratuitamente
Nessuna registrazione richiesta. Analizza il tuo primo file in pochi secondi.