ParseJet

Konverter HTML ke Teks

Tempel URL atau unggah file .html dan dapatkan teks polos yang bersih dengan semua tag, script, dan style terbuang. ParseJet menerjemahkan entitas HTML, menjaga urutan baca, dan mengembalikan teks yang benar-benar bisa Anda pakai — gratis, tanpa perlu mendaftar.

Letakkan file di sini atau telusuri

Menerima file HTML,HTM

Gratis — 3 permintaan/hari, tanpa pendaftaran. untuk 300 kredit/bulan gratis.

Cara kerjanya

1

Unggah HTML atau tempel URL

Letakkan file .html di atas, atau tempel URL halaman yang sedang aktif — keduanya menghasilkan output teks bersih yang sama.

2

Tag dibuang, teks dipertahankan

ParseJet mem-parsing markup-nya, menghapus tag, script, style, dan komentar, lalu menerjemahkan entitas seperti & dan   menjadi karakter asli.

3

Salin teks Anda

Salin teks polosnya untuk pengindeksan pencarian, NLP, atau dibaca — atau panggil API untuk mengonversi HTML ke teks di pipeline Anda sendiri.

Fitur utama

Apa yang membuat html to text ini menonjol.

Penghapusan tag menyeluruh

Semua tag HTML dibuang — termasuk script, inline style, pixel pelacak, dan komentar. Hanya teks yang bisa dibaca manusia yang tersisa.

Entitas diterjemahkan

&,  , —, ’ dan semua entitas lainnya diterjemahkan menjadi karakter aslinya. Output selalu UTF-8 yang bersih.

Urutan baca terjaga

Teks keluar dalam urutan yang akan dibaca orang — bukan urutan sumber DOM yang teracak oleh div tata letak.

HTML berantakan tetap tertangani

Tag yang tidak ditutup, markup warisan yang bersarang, inline style — HTML dunia nyata di-parse tanpa merusak output.

Input file atau URL

Konversi file .html tersimpan atau ambil halaman aktif lewat URL — API yang sama menangani keduanya.

Markdown saat Anda membutuhkannya

Butuh struktur alih-alih teks datar? Endpoint yang sama mengembalikan Markdown dengan heading dan daftar — cukup hilangkan output_format=raw.

Kasus penggunaan

Skenario umum di mana alat ini menghemat waktu Anda.

Pengindeksan pencarian dan NLP

Berikan konten teks halaman ke mesin pencari dan model NLP — tanpa derau markup yang menggelembungkan indeks.

Prapemrosesan input LLM

HTML mentah memboroskan token untuk tag. Buang dulu markup-nya menjadi teks polos agar jauh lebih banyak konten asli yang muat dalam prompt.

Teks email dan newsletter

Ekstrak teks yang bisa dibaca dari email HTML dan newsletter untuk pengarsipan, kutipan, atau versi teks polos.

Output pipeline scraping

Ubah HTML hasil crawling menjadi teks bersih untuk penyimpanan dan analisis — satu panggilan API per dokumen.

Otomatisasi dengan API

Gunakan alat yang sama secara terprogram. Bekerja dengan bahasa apa pun — cukup HTTP.

cURL
# Convert an HTML file to plain text
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Convert a live page by URL
curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/page"}'
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    params={"output_format": "raw"},
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("page.html", "rb")},
)
print(resp.json()["text"])  # plain text, tags stripped
JavaScript
const formData = new FormData();
formData.append("file", htmlFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
  {
    method: "POST",
    headers: { Authorization: "Bearer YOUR_API_KEY" },
    body: formData,
  }
);
const { text } = await res.json(); // plain text

Ingin mengotomatiskan ini?

ParseJet API memberikan kemampuan parsing yang sama melalui satu endpoint HTTP. Tanpa ffmpeg, tanpa poppler, tanpa tesseract — cukup satu panggilan API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Baca Dokumentasi API

Pertanyaan yang sering diajukan

Bagaimana cara mengonversi HTML ke teks polos?

Unggah file .html atau tempel URL di atas — ParseJet membuang semua markup dan mengembalikan teks yang bisa dibaca. Untuk otomatisasi, POST ke /v1/parse/auto/file dengan output_format=raw.

Apakah script dan CSS juga dihapus?

Ya. JavaScript, blok style, inline style, komentar HTML, dan kode pelacak semuanya dihapus — tidak ada yang bocor ke output teks.

Apa yang terjadi pada entitas HTML seperti & dan  ?

Semuanya diterjemahkan menjadi karakter asli (&, spasi, em-dash, tanda kutip lengkung, dan seterusnya), sehingga hasilnya terbaca seperti teks normal, bukan markup ter-escape.

Bisakah saya mengonversi halaman web langsung, bukan file?

Bisa. Tempel URL halamannya pada alat di atas, atau POST ke /v1/parse/webpage — ParseJet mengambil halamannya dan mengekstrak konten utamanya sebagai teks.

Bagaimana jika saya ingin Markdown, bukan teks datar?

Gunakan endpoint yang sama tanpa output_format=raw — ParseJet mengembalikan Markdown dengan heading, daftar, tabel, dan tautan yang tetap utuh. Lihat alat HTML ke Markdown kami.

Apakah gratis?

Ya. Anda mendapatkan 3 konversi gratis per hari tanpa perlu mendaftar, dan akun API gratis mencakup 300 kredit per bulan. Paket berbayar mulai dari $19/bulan.

Mulai ekstraksi teks secara gratis

Tidak perlu mendaftar. Parse file pertama Anda dalam hitungan detik.

Lihat Harga