ParseJet

HTMLをテキストに変換

URLを貼り付けるか.htmlファイルをアップロードするだけで、タグ・スクリプト・スタイルをすべて取り除いたクリーンなプレーンテキストが手に入ります。ParseJetはHTMLの実体参照をデコードし、読み順を保ったまま、実際に使えるテキストを返します。登録なしで無料で使えます。

ここにファイルをドロップするか、 参照

HTML,HTMファイルを受け付けます

無料 — 1日3リクエスト、登録不要。 して月300クレジットを無料で。

仕組み

1

HTMLをアップロード、またはURLを貼る

.htmlファイルを上にドロップするか、公開ページのURLを貼り付けます。どちらでも同じクリーンなテキストが得られます。

2

タグを除去、テキストだけ残す

ParseJetがマークアップを解析してタグ・スクリプト・スタイル・コメントを削除し、&や などの実体参照を実際の文字にデコードします。

3

テキストをコピー

検索インデックス、NLP、閲覧用にプレーンテキストをコピーできます。自分のパイプラインでHTMLをテキスト化する場合はAPIを呼び出してください。

主な機能

このhtml to textが際立つ理由。

タグを完全に除去

スクリプト、インラインスタイル、トラッキングピクセル、コメントを含むすべてのHTMLタグが取り除かれます。残るのは人が読むテキストだけです。

実体参照のデコード

&、 、—、’など、あらゆる実体参照が実際の文字にデコードされます。出力は常にクリーンなUTF-8です。

読み順を保持

テキストは人が読む順序で出力されます。レイアウト用のdivでかき混ぜられたDOMソース順にはなりません。

雑なHTMLでも壊れない

閉じタグ漏れ、入れ子のレガシーな記法、インラインスタイル——現実のHTMLも出力を壊さずに解析できます。

ファイルでもURLでも

保存済みの.htmlファイルの変換も、URLを指定した公開ページの取得も、同じAPIで処理できます。

必要ならMarkdownでも

フラットなテキストではなく構造が必要ですか?同じエンドポイントでoutput_format=rawを外すだけで、見出しとリスト付きのMarkdownが返ります。

ユースケース

このツールが時間を節約する一般的なシナリオ。

検索インデックスとNLP

検索エンジンやNLPモデルに、マークアップのノイズでインデックスを膨らませることなく、ページのテキストコンテンツを渡せます。

LLMへの前処理

生のHTMLはタグでトークンを浪費します。先にプレーンテキスト化すれば、はるかに多くの本文をプロンプトに収められます。

メール・ニュースレターのテキスト化

HTMLメールやニュースレターから読めるテキストを抽出し、アーカイブ、引用、プレーンテキスト版の作成に使えます。

スクレイピング結果の整形

クロールしたHTMLを、保存・分析用のクリーンなテキストに変換できます。1文書につきAPI呼び出し1回です。

APIで自動化

同じツールをプログラムで使用。HTTPのみで、あらゆる言語で動作します。

cURL
# Convert an HTML file to plain text
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Convert a live page by URL
curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/page"}'
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    params={"output_format": "raw"},
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("page.html", "rb")},
)
print(resp.json()["text"])  # plain text, tags stripped
JavaScript
const formData = new FormData();
formData.append("file", htmlFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
  {
    method: "POST",
    headers: { Authorization: "Bearer YOUR_API_KEY" },
    body: formData,
  }
);
const { text } = await res.json(); // plain text

自動化をお求めですか?

ParseJet APIは、単一のHTTPエンドポイントで同じ解析機能を提供します。ffmpeg、poppler、tesseractは不要。APIコール一つだけです。

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
APIドキュメントを読む

よくある質問

HTMLをプレーンテキストに変換するにはどうすればいいですか?

.htmlファイルをアップロードするか、URLを貼り付けてください。ParseJetがマークアップをすべて取り除き、読めるテキストを返します。自動化する場合は /v1/parse/auto/file にoutput_format=rawを付けてPOSTしてください。

スクリプトやCSSも削除されますか?

はい。JavaScript、styleブロック、インラインスタイル、HTMLコメント、トラッキングコードはすべて削除され、テキスト出力に混入することはありません。

&や などのHTMLエンティティはどうなりますか?

実際の文字(&、空白、ダッシュ、引用符など)にデコードされるため、出力はエスケープされたマークアップではなく、普通の文章として読めます。

ファイルではなく公開中のWebページを変換できますか?

はい。ツールにページのURLを貼り付けるか、/v1/parse/webpage にPOSTしてください。ParseJetがページを取得し、本文をテキストとして抽出します。

フラットなテキストではなくMarkdownが欲しい場合は?

同じエンドポイントをoutput_format=rawなしで呼び出してください。見出し・リスト・表・リンクを保持したMarkdownが返ります。「HTMLをMarkdownに変換」ツールもご覧ください。

無料で使えますか?

はい。登録なしで1日3回まで無料で変換でき、無料APIアカウントには月300クレジットが含まれます。有料プランは月額$19からです。

無料でテキスト抽出を始める

サインアップ不要。数秒で最初のファイルを解析。

料金を見る