ParseJet

Convertir HTML a texto

Pega una URL o sube un archivo .html y obtén texto plano limpio, sin una sola etiqueta, script ni estilo. ParseJet decodifica las entidades HTML, respeta el orden de lectura y devuelve texto que puedes usar de verdad — gratis y sin registro.

Suelta un archivo aquí o explorar

Acepta archivos HTML,HTM

Gratis — 3 solicitudes/día, sin registro. para 300 créditos/mes gratis.

Cómo funciona

1

Sube el HTML o pega una URL

Arrastra un archivo .html arriba, o pega la URL de una página en vivo — ambas vías producen el mismo texto limpio.

2

Fuera etiquetas, el texto se queda

ParseJet analiza el marcado, elimina etiquetas, scripts, estilos y comentarios, y decodifica entidades como & y   en caracteres reales.

3

Copia tu texto

Copia el texto plano para indexación, NLP o lectura — o llama a la API para convertir HTML a texto dentro de tu propio pipeline.

Características principales

Lo que hace que este html to text destaque.

Eliminación total de etiquetas

Desaparece cada etiqueta HTML — incluidos scripts, estilos en línea, píxeles de seguimiento y comentarios. Solo queda el texto legible por humanos.

Decodificación de entidades

&,  , —, ’ y cualquier otra entidad se decodifican a su carácter real. La salida siempre es UTF-8 limpio.

Orden de lectura conservado

El texto sale en el orden en que una persona lo leería — no en el orden del código fuente revuelto por los divs de maquetación.

Tolera el HTML sucio

Etiquetas sin cerrar, marcado heredado anidado, estilos en línea — el HTML del mundo real se analiza sin romper la salida.

Archivo o URL como entrada

Convierte archivos .html guardados o descarga una página en vivo por URL — la misma API sirve para ambos casos.

Markdown cuando lo necesites

¿Prefieres estructura en lugar de texto plano? El mismo endpoint devuelve Markdown con encabezados y listas — basta con omitir output_format=raw.

Casos de uso

Escenarios comunes donde esta herramienta te ahorra tiempo.

Indexación de búsqueda y NLP

Alimenta buscadores y modelos de NLP con el contenido textual de las páginas — sin que el ruido del marcado infle el índice.

Preprocesado para LLM

El HTML en bruto desperdicia tokens en etiquetas. Conviértelo antes a texto plano y cabrá mucho más contenido real en el prompt.

Texto de emails y newsletters

Extrae el texto legible de correos HTML y newsletters para archivarlo, citarlo o generar versiones en texto plano.

Salida de pipelines de scraping

Convierte el HTML rastreado en texto limpio para almacenarlo y analizarlo — una llamada a la API por documento.

Automatiza con la API

Usa la misma herramienta de forma programática. Funciona con cualquier lenguaje — solo HTTP.

cURL
# Convert an HTML file to plain text
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Convert a live page by URL
curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/page"}'
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    params={"output_format": "raw"},
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("page.html", "rb")},
)
print(resp.json()["text"])  # plain text, tags stripped
JavaScript
const formData = new FormData();
formData.append("file", htmlFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
  {
    method: "POST",
    headers: { Authorization: "Bearer YOUR_API_KEY" },
    body: formData,
  }
);
const { text } = await res.json(); // plain text

¿Quieres automatizar esto?

ParseJet API te ofrece el mismo poder de análisis a través de un único endpoint HTTP. Sin ffmpeg, sin poppler, sin tesseract — solo una llamada a la API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Leer Documentación de la API

Preguntas frecuentes

¿Cómo convierto código HTML a texto plano?

Sube un archivo .html o pega una URL arriba — ParseJet elimina todo el marcado y devuelve el texto legible. Para automatizarlo, envía POST a /v1/parse/auto/file con output_format=raw.

¿Elimina también los scripts y el CSS?

Sí. El JavaScript, los bloques de estilo, los estilos en línea, los comentarios HTML y el código de seguimiento se eliminan por completo — nada de eso se cuela en el texto.

¿Qué pasa con entidades HTML como & y  ?

Se decodifican a su carácter real (&, un espacio, rayas, comillas tipográficas, etcétera), de modo que la salida se lee como texto normal, no como marcado escapado.

¿Puedo convertir una página web en vivo en lugar de un archivo?

Sí. Pega la URL de la página en la herramienta, o envíala con POST a /v1/parse/webpage — ParseJet descarga la página y extrae el contenido principal como texto.

¿Y si quiero Markdown en lugar de texto plano?

Usa el mismo endpoint sin output_format=raw — ParseJet devuelve Markdown con encabezados, listas, tablas y enlaces conservados. Mira nuestra herramienta de HTML a Markdown.

¿Es gratis?

Sí. Tienes 3 conversiones gratis al día sin registro, y la cuenta gratuita de la API incluye 300 créditos al mes. Los planes de pago comienzan en $19/mes.

Comienza a extraer texto gratis

No requiere registro. Analiza tu primer archivo en segundos.

Ver Precios