Conversor de HTML para Texto
Cole uma URL ou envie um arquivo .html e receba texto puro e limpo, com todas as tags, scripts e estilos removidos. O ParseJet decodifica as entidades HTML, mantém a ordem de leitura e devolve texto que você pode realmente usar — grátis, sem cadastro.
Solte um arquivo aqui ou procure
Aceita arquivos HTML,HTM
Grátis — 3 requisições/dia, sem cadastro. para 300 créditos/mês grátis.
Como funciona
Envie o HTML ou cole uma URL
Arraste um arquivo .html acima ou cole a URL de uma página no ar — os dois caminhos produzem o mesmo texto limpo.
Tags removidas, texto preservado
O ParseJet faz o parsing da marcação, remove tags, scripts, estilos e comentários e decodifica entidades como & e em caracteres de verdade.
Copie o seu texto
Copie o texto puro para indexação de busca, NLP ou leitura — ou chame a API para converter HTML em texto no seu próprio pipeline.
Principais recursos
O que faz este html to text se destacar.
Remoção completa de tags
Toda tag HTML vai embora — incluindo scripts, estilos inline, pixels de rastreamento e comentários. Só o texto legível por humanos permanece.
Decodificação de entidades
&, , —, ’ e todas as outras entidades são decodificadas para o caractere real. A saída é sempre UTF-8 limpo.
Ordem de leitura preservada
O texto sai na ordem em que uma pessoa leria a página — não na ordem do código-fonte embaralhada por divs de layout.
HTML bagunçado sem drama
Tags não fechadas, marcação legada aninhada, estilos inline — o HTML do mundo real é processado sem quebrar a saída.
Entrada por arquivo ou URL
Converta arquivos .html salvos ou busque uma página no ar pela URL — a mesma API atende aos dois casos.
Markdown quando você quiser
Precisa de estrutura em vez de texto plano? O mesmo endpoint devolve Markdown com títulos e listas — basta omitir output_format=raw.
Casos de uso
Cenários comuns onde esta ferramenta economiza seu tempo.
Indexação de busca e NLP
Alimente mecanismos de busca e modelos de NLP com o conteúdo textual das páginas — sem o ruído da marcação inflando o índice.
Pré-processamento de entrada para LLM
HTML cru desperdiça tokens com tags. Converta antes para texto puro e caiba muito mais conteúdo real no prompt.
Texto de e-mails e newsletters
Extraia o texto legível de e-mails em HTML e newsletters para arquivar, citar ou gerar versões em texto puro.
Saída de pipeline de scraping
Transforme o HTML coletado pelo crawler em texto limpo para armazenamento e análise — uma chamada de API por documento.
Automatize com a API
Use a mesma ferramenta de forma programática. Funciona com qualquer linguagem — apenas HTTP.
# Convert an HTML file to plain text curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Convert a live page by URL curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"url": "https://example.com/page"}'
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
params={"output_format": "raw"},
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("page.html", "rb")},
)
print(resp.json()["text"]) # plain text, tags stripped const formData = new FormData();
formData.append("file", htmlFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
{
method: "POST",
headers: { Authorization: "Bearer YOUR_API_KEY" },
body: formData,
}
);
const { text } = await res.json(); // plain text Quer automatizar isso?
A ParseJet API oferece o mesmo poder de análise através de um único endpoint HTTP. Sem ffmpeg, sem poppler, sem tesseract — apenas uma chamada de API.
Perguntas frequentes
Como converter HTML para texto?
Envie um arquivo .html ou cole uma URL acima — o ParseJet remove toda a marcação e devolve o texto legível. Para automatizar, envie um POST para /v1/parse/auto/file com output_format=raw.
Ele remove scripts e CSS também?
Sim. JavaScript, blocos de estilo, estilos inline, comentários e código de rastreamento são todos removidos — nada disso vaza para a saída. É o jeito mais rápido de transformar código HTML em texto puro.
O que acontece com entidades HTML como & e ?
Elas são decodificadas para o caractere real (&, espaço, travessões, aspas curvas e assim por diante), então a saída se lê como texto normal, não como marcação escapada.
Posso converter uma página no ar em vez de um arquivo?
Sim. Cole a URL da página na ferramenta ou envie um POST para /v1/parse/webpage — o ParseJet busca a página e extrai o conteúdo principal como texto.
E se eu quiser Markdown em vez de texto plano?
Use o mesmo endpoint sem output_format=raw — o ParseJet devolve Markdown com títulos, listas, tabelas e links preservados. Veja a nossa ferramenta de HTML para Markdown.
É grátis?
Sim. Você tem 3 conversões gratuitas por dia sem cadastro, e a conta gratuita de API inclui 300 créditos por mês. Os planos pagos começam em US$ 19/mês.
Ferramentas relacionadas
HTML to Markdown Converter
Convert HTML to Markdown online for free. Upload an HTML file or paste a URL — get clean Markdown with headings, lists, tables, and links preserved.
URL to Markdown Converter
Convert any URL to clean Markdown online for free. Paste a link and get the page's main content as Markdown — no ads, no navigation. API available.
PDF to Text Converter
Convert PDF to plain text online for free. Handles multi-page documents, scanned PDFs with OCR, and complex layouts. No signup — or automate via API.
Comece a extrair texto gratuitamente
Sem necessidade de cadastro. Analise seu primeiro arquivo em segundos.