ParseJet

Konwerter HTML na tekst

Wklej adres URL lub prześlij plik .html, a otrzymasz czysty tekst z usuniętym każdym znacznikiem, skryptem i stylem. ParseJet dekoduje encje HTML, zachowuje kolejność czytania i zwraca tekst, którego naprawdę można użyć — za darmo, bez rejestracji.

Upuść plik tutaj lub przeglądaj

Akceptuje pliki HTML,HTM

Darmowe — 3 żądania/dzień, bez rejestracji. za 300 kredytów/miesiąc za darmo.

Jak to działa

1

Prześlij HTML lub wklej URL

Upuść plik .html powyżej albo wklej adres działającej strony — obie ścieżki dają ten sam czysty tekst.

2

Znaczniki znikają, tekst zostaje

ParseJet parsuje kod, usuwa znaczniki, skrypty, style i komentarze, a encje takie jak & i   dekoduje na prawdziwe znaki.

3

Skopiuj swój tekst

Skopiuj czysty tekst do indeksowania, NLP lub czytania — albo wywołuj API, aby konwertować HTML na tekst we własnym potoku.

Kluczowe funkcje

Co wyróżnia to html to text.

Całkowite usuwanie znaczników

Znika każdy znacznik HTML — łącznie ze skryptami, stylami inline, pikselami śledzącymi i komentarzami. Zostaje wyłącznie tekst czytelny dla człowieka.

Dekodowanie encji

&,  , —, ’ i każda inna encja są dekodowane na prawdziwe znaki. Wynik to zawsze czysty UTF-8.

Zachowana kolejność czytania

Tekst wychodzi w takiej kolejności, w jakiej czytałby go człowiek — a nie w kolejności źródła DOM poprzestawianej przez divy układu strony.

Niechlujny HTML nie jest problemem

Niezamknięte znaczniki, zagnieżdżony archaiczny kod, style inline — prawdziwy HTML parsuje się bez psucia wyniku.

Plik albo adres URL

Konwertuj zapisane pliki .html albo pobieraj działające strony po adresie URL — ten sam endpoint obsłuży oba przypadki.

Markdown, gdy go potrzebujesz

Wolisz strukturę zamiast płaskiego tekstu? Ten sam endpoint zwraca Markdown z nagłówkami i listami — wystarczy pominąć output_format=raw.

Przykłady zastosowań

Typowe scenariusze, w których to narzędzie oszczędza czas.

Indeksowanie wyszukiwania i NLP

Podawaj wyszukiwarkom i modelom NLP samą treść tekstową stron — bez szumu znaczników zaśmiecającego indeks.

Wstępne przetwarzanie danych dla LLM

Surowy HTML marnuje tokeny na znaczniki. Najpierw sprowadź go do czystego tekstu i zmieść w prompcie znacznie więcej prawdziwej treści.

Tekst z e-maili i newsletterów

Wyodrębniaj czytelny tekst z e-maili i newsletterów HTML do archiwizacji, cytowania lub wersji czysto tekstowych.

Wyjście potoku scrapującego

Zamieniaj HTML zebrany przez crawlera na czysty tekst do przechowywania i analizy — jedno wywołanie API na dokument.

Automatyzuj za pomocą API

Użyj tego samego narzędzia programistycznie. Działa z dowolnym językiem — wystarczy HTTP.

cURL
# Convert an HTML file to plain text
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Convert a live page by URL
curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/page"}'
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    params={"output_format": "raw"},
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("page.html", "rb")},
)
print(resp.json()["text"])  # plain text, tags stripped
JavaScript
const formData = new FormData();
formData.append("file", htmlFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
  {
    method: "POST",
    headers: { Authorization: "Bearer YOUR_API_KEY" },
    body: formData,
  }
);
const { text } = await res.json(); // plain text

Chcesz to zautomatyzować?

ParseJet API daje Ci tę samą moc parsowania przez jeden punkt końcowy HTTP. Bez ffmpeg, bez poppler, bez tesseract — tylko jedno wywołanie API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Przeczytaj dokumentację API

Często zadawane pytania

Jak przekonwertować HTML na czysty tekst?

Prześlij plik .html lub wklej adres URL powyżej — ParseJet usunie cały kod i zwróci czytelny tekst. Do automatyzacji wyślij POST na /v1/parse/auto/file z output_format=raw.

Czy skrypty i CSS też są usuwane?

Tak. JavaScript, bloki stylów, style inline, komentarze HTML i kod śledzący są usuwane w całości — nic z tego nie przecieka do tekstu wynikowego.

Co się dzieje z encjami HTML, np. & i  ?

Są dekodowane na prawdziwe znaki (&, spacja, pauzy, typograficzne cudzysłowy itd.), więc wynik czyta się jak normalny tekst, a nie zaescapowany kod.

Czy mogę przekonwertować działającą stronę zamiast pliku?

Tak. Wklej adres strony w narzędziu albo wyślij go POST-em na /v1/parse/webpage — ParseJet pobierze stronę i wyodrębni główną treść jako tekst.

A jeśli wolę Markdown zamiast płaskiego tekstu?

Użyj tego samego endpointu bez output_format=raw — ParseJet zwróci Markdown z zachowanymi nagłówkami, listami, tabelami i linkami. Zobacz nasz konwerter HTML na Markdown.

Czy to jest darmowe?

Tak. Masz 3 darmowe konwersje dziennie bez rejestracji, a darmowe konto API obejmuje 300 kredytów miesięcznie. Plany płatne zaczynają się od 19 USD/miesiąc.

Zacznij bezpłatnie wyodrębniać tekst

Bez rejestracji. Przeanalizuj swój pierwszy plik w kilka sekund.

Zobacz cennik