HTMLをテキストに変換
URLを貼り付けるか.htmlファイルをアップロードするだけで、タグ・スクリプト・スタイルをすべて取り除いたクリーンなプレーンテキストが手に入ります。ParseJetはHTMLの実体参照をデコードし、読み順を保ったまま、実際に使えるテキストを返します。登録なしで無料で使えます。
ここにファイルをドロップするか、 参照
HTML,HTMファイルを受け付けます
無料 — 1日3リクエスト、登録不要。 して月300クレジットを無料で。
仕組み
HTMLをアップロード、またはURLを貼る
.htmlファイルを上にドロップするか、公開ページのURLを貼り付けます。どちらでも同じクリーンなテキストが得られます。
タグを除去、テキストだけ残す
ParseJetがマークアップを解析してタグ・スクリプト・スタイル・コメントを削除し、&や などの実体参照を実際の文字にデコードします。
テキストをコピー
検索インデックス、NLP、閲覧用にプレーンテキストをコピーできます。自分のパイプラインでHTMLをテキスト化する場合はAPIを呼び出してください。
主な機能
このhtml to textが際立つ理由。
タグを完全に除去
スクリプト、インラインスタイル、トラッキングピクセル、コメントを含むすべてのHTMLタグが取り除かれます。残るのは人が読むテキストだけです。
実体参照のデコード
&、 、—、’など、あらゆる実体参照が実際の文字にデコードされます。出力は常にクリーンなUTF-8です。
読み順を保持
テキストは人が読む順序で出力されます。レイアウト用のdivでかき混ぜられたDOMソース順にはなりません。
雑なHTMLでも壊れない
閉じタグ漏れ、入れ子のレガシーな記法、インラインスタイル——現実のHTMLも出力を壊さずに解析できます。
ファイルでもURLでも
保存済みの.htmlファイルの変換も、URLを指定した公開ページの取得も、同じAPIで処理できます。
必要ならMarkdownでも
フラットなテキストではなく構造が必要ですか?同じエンドポイントでoutput_format=rawを外すだけで、見出しとリスト付きのMarkdownが返ります。
ユースケース
このツールが時間を節約する一般的なシナリオ。
検索インデックスとNLP
検索エンジンやNLPモデルに、マークアップのノイズでインデックスを膨らませることなく、ページのテキストコンテンツを渡せます。
LLMへの前処理
生のHTMLはタグでトークンを浪費します。先にプレーンテキスト化すれば、はるかに多くの本文をプロンプトに収められます。
メール・ニュースレターのテキスト化
HTMLメールやニュースレターから読めるテキストを抽出し、アーカイブ、引用、プレーンテキスト版の作成に使えます。
スクレイピング結果の整形
クロールしたHTMLを、保存・分析用のクリーンなテキストに変換できます。1文書につきAPI呼び出し1回です。
APIで自動化
同じツールをプログラムで使用。HTTPのみで、あらゆる言語で動作します。
# Convert an HTML file to plain text curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Convert a live page by URL curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"url": "https://example.com/page"}'
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
params={"output_format": "raw"},
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("page.html", "rb")},
)
print(resp.json()["text"]) # plain text, tags stripped const formData = new FormData();
formData.append("file", htmlFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
{
method: "POST",
headers: { Authorization: "Bearer YOUR_API_KEY" },
body: formData,
}
);
const { text } = await res.json(); // plain text 自動化をお求めですか?
ParseJet APIは、単一のHTTPエンドポイントで同じ解析機能を提供します。ffmpeg、poppler、tesseractは不要。APIコール一つだけです。
よくある質問
HTMLをプレーンテキストに変換するにはどうすればいいですか?
.htmlファイルをアップロードするか、URLを貼り付けてください。ParseJetがマークアップをすべて取り除き、読めるテキストを返します。自動化する場合は /v1/parse/auto/file にoutput_format=rawを付けてPOSTしてください。
スクリプトやCSSも削除されますか?
はい。JavaScript、styleブロック、インラインスタイル、HTMLコメント、トラッキングコードはすべて削除され、テキスト出力に混入することはありません。
&や などのHTMLエンティティはどうなりますか?
実際の文字(&、空白、ダッシュ、引用符など)にデコードされるため、出力はエスケープされたマークアップではなく、普通の文章として読めます。
ファイルではなく公開中のWebページを変換できますか?
はい。ツールにページのURLを貼り付けるか、/v1/parse/webpage にPOSTしてください。ParseJetがページを取得し、本文をテキストとして抽出します。
フラットなテキストではなくMarkdownが欲しい場合は?
同じエンドポイントをoutput_format=rawなしで呼び出してください。見出し・リスト・表・リンクを保持したMarkdownが返ります。「HTMLをMarkdownに変換」ツールもご覧ください。
無料で使えますか?
はい。登録なしで1日3回まで無料で変換でき、無料APIアカウントには月300クレジットが含まれます。有料プランは月額$19からです。
関連ツール
HTML to Markdown Converter
Convert HTML to Markdown online for free. Upload an HTML file or paste a URL — get clean Markdown with headings, lists, tables, and links preserved.
URL to Markdown Converter
Convert any URL to clean Markdown online for free. Paste a link and get the page's main content as Markdown — no ads, no navigation. API available.
PDF to Text Converter
Convert PDF to plain text online for free. Handles multi-page documents, scanned PDFs with OCR, and complex layouts. No signup — or automate via API.