ParseJet

Conversor de HTML para Texto

Cole uma URL ou envie um arquivo .html e receba texto puro e limpo, com todas as tags, scripts e estilos removidos. O ParseJet decodifica as entidades HTML, mantém a ordem de leitura e devolve texto que você pode realmente usar — grátis, sem cadastro.

Solte um arquivo aqui ou procure

Aceita arquivos HTML,HTM

Grátis — 3 requisições/dia, sem cadastro. para 300 créditos/mês grátis.

Como funciona

1

Envie o HTML ou cole uma URL

Arraste um arquivo .html acima ou cole a URL de uma página no ar — os dois caminhos produzem o mesmo texto limpo.

2

Tags removidas, texto preservado

O ParseJet faz o parsing da marcação, remove tags, scripts, estilos e comentários e decodifica entidades como & e   em caracteres de verdade.

3

Copie o seu texto

Copie o texto puro para indexação de busca, NLP ou leitura — ou chame a API para converter HTML em texto no seu próprio pipeline.

Principais recursos

O que faz este html to text se destacar.

Remoção completa de tags

Toda tag HTML vai embora — incluindo scripts, estilos inline, pixels de rastreamento e comentários. Só o texto legível por humanos permanece.

Decodificação de entidades

&,  , —, ’ e todas as outras entidades são decodificadas para o caractere real. A saída é sempre UTF-8 limpo.

Ordem de leitura preservada

O texto sai na ordem em que uma pessoa leria a página — não na ordem do código-fonte embaralhada por divs de layout.

HTML bagunçado sem drama

Tags não fechadas, marcação legada aninhada, estilos inline — o HTML do mundo real é processado sem quebrar a saída.

Entrada por arquivo ou URL

Converta arquivos .html salvos ou busque uma página no ar pela URL — a mesma API atende aos dois casos.

Markdown quando você quiser

Precisa de estrutura em vez de texto plano? O mesmo endpoint devolve Markdown com títulos e listas — basta omitir output_format=raw.

Casos de uso

Cenários comuns onde esta ferramenta economiza seu tempo.

Indexação de busca e NLP

Alimente mecanismos de busca e modelos de NLP com o conteúdo textual das páginas — sem o ruído da marcação inflando o índice.

Pré-processamento de entrada para LLM

HTML cru desperdiça tokens com tags. Converta antes para texto puro e caiba muito mais conteúdo real no prompt.

Texto de e-mails e newsletters

Extraia o texto legível de e-mails em HTML e newsletters para arquivar, citar ou gerar versões em texto puro.

Saída de pipeline de scraping

Transforme o HTML coletado pelo crawler em texto limpo para armazenamento e análise — uma chamada de API por documento.

Automatize com a API

Use a mesma ferramenta de forma programática. Funciona com qualquer linguagem — apenas HTTP.

cURL
# Convert an HTML file to plain text
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Convert a live page by URL
curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/page"}'
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    params={"output_format": "raw"},
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("page.html", "rb")},
)
print(resp.json()["text"])  # plain text, tags stripped
JavaScript
const formData = new FormData();
formData.append("file", htmlFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
  {
    method: "POST",
    headers: { Authorization: "Bearer YOUR_API_KEY" },
    body: formData,
  }
);
const { text } = await res.json(); // plain text

Quer automatizar isso?

A ParseJet API oferece o mesmo poder de análise através de um único endpoint HTTP. Sem ffmpeg, sem poppler, sem tesseract — apenas uma chamada de API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Ler Documentação da API

Perguntas frequentes

Como converter HTML para texto?

Envie um arquivo .html ou cole uma URL acima — o ParseJet remove toda a marcação e devolve o texto legível. Para automatizar, envie um POST para /v1/parse/auto/file com output_format=raw.

Ele remove scripts e CSS também?

Sim. JavaScript, blocos de estilo, estilos inline, comentários e código de rastreamento são todos removidos — nada disso vaza para a saída. É o jeito mais rápido de transformar código HTML em texto puro.

O que acontece com entidades HTML como & e  ?

Elas são decodificadas para o caractere real (&, espaço, travessões, aspas curvas e assim por diante), então a saída se lê como texto normal, não como marcação escapada.

Posso converter uma página no ar em vez de um arquivo?

Sim. Cole a URL da página na ferramenta ou envie um POST para /v1/parse/webpage — o ParseJet busca a página e extrai o conteúdo principal como texto.

E se eu quiser Markdown em vez de texto plano?

Use o mesmo endpoint sem output_format=raw — o ParseJet devolve Markdown com títulos, listas, tabelas e links preservados. Veja a nossa ferramenta de HTML para Markdown.

É grátis?

Sim. Você tem 3 conversões gratuitas por dia sem cadastro, e a conta gratuita de API inclui 300 créditos por mês. Os planos pagos começam em US$ 19/mês.

Comece a extrair texto gratuitamente

Sem necessidade de cadastro. Analise seu primeiro arquivo em segundos.

Ver Preços