ParseJet

Конвертер HTML в текст

Вставьте ссылку или загрузите .html-файл — и получите чистый текст без единого тега, скрипта или стиля. ParseJet декодирует HTML-сущности, сохраняет порядок чтения и возвращает текст, с которым действительно можно работать, — бесплатно и без регистрации.

Перетащите файл сюда или выберите

Принимает файлы HTML,HTM

Бесплатно — 3 запроса/день, без регистрации. для 300 кредитов/месяц бесплатно.

Как это работает

1

Загрузите HTML или вставьте URL

Перетащите .html-файл выше или вставьте адрес живой страницы — оба способа дают одинаково чистый текст.

2

Теги удаляются, текст остаётся

ParseJet разбирает разметку, удаляет теги, скрипты, стили и комментарии, а сущности вроде & и   декодирует в настоящие символы.

3

Скопируйте текст

Скопируйте чистый текст для поискового индекса, NLP или чтения — или вызывайте API, чтобы конвертировать HTML в текст в своём пайплайне.

Ключевые особенности

Что отличает этот html to text.

Полное удаление тегов

Удаляется каждый HTML-тег — включая скрипты, инлайновые стили, трекинг-пиксели и комментарии. Остаётся только читаемый человеком текст.

Декодирование сущностей

&,  , —, ’ и любая другая сущность превращаются в настоящий символ. Вывод — всегда чистый UTF-8.

Порядок чтения сохраняется

Текст выходит в том порядке, в каком его читал бы человек, — а не в порядке DOM-исходника, перемешанном вёрсткой из div.

Грязный HTML не проблема

Незакрытые теги, вложенная легаси-разметка, инлайновые стили — реальный HTML разбирается без поломки результата.

Файл или URL на выбор

Конвертируйте сохранённые .html-файлы или забирайте живую страницу по ссылке — оба случая обрабатывает один и тот же API.

Markdown, когда он нужен

Нужна структура вместо плоского текста? Тот же эндпоинт возвращает Markdown с заголовками и списками — просто уберите output_format=raw.

Примеры использования

Типичные сценарии, где этот инструмент экономит ваше время.

Поисковая индексация и NLP

Передавайте поисковым движкам и NLP-моделям текстовое содержимое страниц — без разметочного шума, раздувающего индекс.

Подготовка входа для LLM

Сырой HTML тратит токены на теги. Сначала уберите разметку — и в промпт поместится куда больше реального содержания.

Текст писем и рассылок

Извлекайте читаемый текст из HTML-писем и рассылок для архива, цитирования или plain-text-версий.

Выход скрейпинг-пайплайна

Превращайте собранный краулером HTML в чистый текст для хранения и анализа — один вызов API на документ.

Автоматизируйте с помощью API

Используйте тот же инструмент программно. Работает с любым языком — только HTTP.

cURL
# Convert an HTML file to plain text
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Convert a live page by URL
curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/page"}'
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    params={"output_format": "raw"},
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("page.html", "rb")},
)
print(resp.json()["text"])  # plain text, tags stripped
JavaScript
const formData = new FormData();
formData.append("file", htmlFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
  {
    method: "POST",
    headers: { Authorization: "Bearer YOUR_API_KEY" },
    body: formData,
  }
);
const { text } = await res.json(); // plain text

Хотите автоматизировать это?

ParseJet API предоставляет те же возможности парсинга через один HTTP-эндпоинт. Никакого ffmpeg, poppler или tesseract — всего один вызов API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Читать документацию API

Часто задаваемые вопросы

Как конвертировать HTML в обычный текст?

Загрузите .html-файл или вставьте URL выше — ParseJet удалит всю разметку и вернёт читаемый текст. Для автоматизации отправьте POST на /v1/parse/auto/file с параметром output_format=raw.

Удаляются ли скрипты и CSS?

Да. JavaScript, блоки стилей, инлайновые стили, HTML-комментарии и трекинговый код удаляются полностью — ничего из этого не попадёт в текстовый вывод.

Что происходит с HTML-сущностями вроде & и  ?

Они декодируются в настоящие символы (&, пробел, тире, «правильные» кавычки и так далее), поэтому результат читается как обычный текст, а не экранированная разметка.

Можно ли конвертировать живую страницу, а не файл?

Да. Вставьте адрес страницы в форму или отправьте его POST-запросом на /v1/parse/webpage — ParseJet загрузит страницу и извлечёт основной контент как текст.

А если нужен Markdown, а не плоский текст?

Используйте тот же эндпоинт без output_format=raw — ParseJet вернёт Markdown с сохранёнными заголовками, списками, таблицами и ссылками. Смотрите наш конвертер HTML в Markdown.

Это бесплатно?

Да. 3 бесплатные конвертации в день без регистрации, бесплатный API-аккаунт включает 300 кредитов в месяц. Платные тарифы — от $19/мес.

Начните извлекать текст бесплатно

Регистрация не требуется. Обработайте первый файл за секунды.

Посмотреть тарифы