ParseJet

HTML'den Metne Dönüştürücü

Bir URL yapıştırın veya bir .html dosyası yükleyin; tüm etiketlerden, betiklerden ve stillerden arındırılmış temiz düz metin alın. ParseJet HTML varlıklarını çözer, okuma sırasını korur ve gerçekten kullanabileceğiniz metni döndürür — ücretsiz, kayıt gerekmez.

Bir dosyayı buraya bırakın veya göz atın

HTML,HTM dosyalarını kabul eder

Ücretsiz — günde 3 istek, kayıt gerekmez. ayda 300 kredi ücretsiz için.

Nasıl çalışır

1

HTML yükleyin veya URL yapıştırın

Yukarıya bir .html dosyası bırakın ya da yayındaki bir sayfanın URL'sini yapıştırın — iki yol da aynı temiz metin çıktısını verir.

2

Etiketler gider, metin kalır

ParseJet işaretlemeyi ayrıştırır; etiketleri, betikleri, stilleri ve yorumları kaldırır; & ve   gibi varlıkları gerçek karakterlere çözer.

3

Metninizi kopyalayın

Düz metni arama indeksleme, NLP veya okuma için kopyalayın — ya da kendi işlem hattınızda HTML'i metne çevirmek için API'yi çağırın.

Temel özellikler

Bu html to text aracını öne çıkaran özellikler.

Eksiksiz etiket temizliği

Betikler, satır içi stiller, izleme pikselleri ve yorumlar dahil tüm HTML etiketleri kaldırılır. Geriye yalnızca insanın okuyacağı metin kalır.

Varlık çözme

&,  , —, ’ ve diğer tüm varlıklar gerçek karakterlerine çözülür. Çıktı her zaman temiz UTF-8'dir.

Okuma sırası korunur

Metin, yerleşim div'lerinin karıştırdığı DOM kaynak sırasına göre değil, bir insanın okuyacağı sırada gelir.

Dağınık HTML sorun değil

Kapatılmamış etiketler, iç içe eski işaretleme, satır içi stiller — gerçek dünyanın HTML'i çıktıyı bozmadan ayrıştırılır.

Dosya veya URL girişi

Kayıtlı .html dosyalarını dönüştürün ya da yayındaki bir sayfayı URL ile getirin — aynı API her ikisini de karşılar.

İsterseniz Markdown

Düz metin yerine yapı mı gerekiyor? output_format=raw parametresini atlarsanız aynı endpoint başlıklı ve listeli Markdown döndürür.

Kullanım senaryoları

Bu aracın size zaman kazandırdığı yaygın senaryolar.

Arama indeksleme ve NLP

Arama motorlarına ve NLP modellerine sayfaların metin içeriğini verin — indeksinizi işaretleme gürültüsü şişirmesin.

LLM girdisi ön işleme

Ham HTML, token'ları etiketlere harcar. Önce düz metne indirin; bir prompt'a çok daha fazla gerçek içerik sığdırın.

E-posta ve bülten metni

HTML e-postaların ve bültenlerin okunabilir metnini arşivleme, alıntı veya düz metin sürümleri için çıkarın.

Kazıma hattı çıktısı

Taranan HTML'i saklama ve analiz için temiz metne çevirin — belge başına tek API çağrısı.

API ile otomatikleştirin

Aynı aracı programatik olarak kullanın. Herhangi bir dil ile çalışır — sadece HTTP.

cURL
# Convert an HTML file to plain text
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Convert a live page by URL
curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/page"}'
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    params={"output_format": "raw"},
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("page.html", "rb")},
)
print(resp.json()["text"])  # plain text, tags stripped
JavaScript
const formData = new FormData();
formData.append("file", htmlFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
  {
    method: "POST",
    headers: { Authorization: "Bearer YOUR_API_KEY" },
    body: formData,
  }
);
const { text } = await res.json(); // plain text

Bunu otomatikleştirmek mi istiyorsunuz?

ParseJet API, aynı ayrıştırma gücünü tek bir HTTP endpoint'i ile sunar. ffmpeg yok, poppler yok, tesseract yok — sadece bir API çağrısı.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
API Dokümanlarını Okuyun

Sıkça sorulan sorular

HTML'i düz metne nasıl dönüştürürüm?

Yukarıya bir .html dosyası yükleyin veya URL yapıştırın — ParseJet tüm işaretlemeyi temizler ve okunabilir metni döndürür. Otomasyon için output_format=raw ile /v1/parse/auto/file adresine POST edin.

Betikleri ve CSS'i de kaldırıyor mu?

Evet. JavaScript, stil blokları, satır içi stiller, HTML yorumları ve izleme kodlarının tümü kaldırılır — hiçbiri metin çıktısına sızmaz.

& ve   gibi HTML varlıklarına ne oluyor?

Gerçek karakterlerine çözülürler (&, boşluk, uzun tire, kıvrık tırnak vb.); böylece çıktı, kaçış işaretli işaretleme gibi değil, normal metin gibi okunur.

Dosya yerine yayındaki bir web sayfasını dönüştürebilir miyim?

Evet. Sayfa URL'sini yukarıdaki araca yapıştırın ya da /v1/parse/webpage adresine POST edin — ParseJet sayfayı getirir ve ana içeriği metin olarak çıkarır.

Düz metin yerine Markdown istersem?

Aynı endpoint'i output_format=raw olmadan kullanın — ParseJet başlıkları, listeleri, tabloları ve bağlantıları korunmuş Markdown döndürür. HTML'den Markdown'a aracımıza bakın.

Ücretsiz mi?

Evet. Kayıt olmadan günde 3 ücretsiz dönüştürme hakkınız olur; ücretsiz API hesabı ayda 300 kredi içerir. Ücretli planlar ayda 19$'dan başlar.

Ücretsiz metin çıkarmaya başlayın

Kayıt gerekmez. İlk dosyanızı saniyeler içinde ayrıştırın.