HTML 轉純文字工具
貼上網址或上傳 .html 檔案,就能取得乾淨的純文字 — 所有標籤、script 與樣式全部移除。ParseJet 會解碼 HTML 字元實體、保留閱讀順序,回傳真正可以直接使用的文字 — 免費,無需註冊。
將檔案拖放到此處或 瀏覽
接受 HTML,HTM 檔案
免費 — 每日 3 次請求,無需註冊。 即可獲得每月 300 點免費額度。
運作原理
上傳 HTML 或貼上網址
將 .html 檔案拖曳至上方,或貼上線上頁面的網址 — 兩種方式都會產生同樣乾淨的純文字輸出。
移除標籤、留下文字
ParseJet 會解析標記,移除標籤、script、樣式與註解,並把 &、 等字元實體解碼成真正的字元。
複製您的文字
複製純文字拿去做搜尋索引、NLP 或閱讀 — 或呼叫 API,在您自己的管線裡把 HTML 轉成文字。
主要功能
這個 html to text 的突出之處。
標籤完全移除
每一個 HTML 標籤都會被清掉 — 包括 script、行內樣式、追蹤像素與註解。只留下人類可閱讀的文字。
字元實體解碼
&、 、—、’ 等所有字元實體都會解碼成真正的字元。輸出一律是乾淨的 UTF-8。
保留閱讀順序
文字會依照人實際閱讀的順序輸出 — 而不是被版面 div 打亂的 DOM 原始碼順序。
雜亂的 HTML 也能處理
未關閉的標籤、層層巢狀的老舊標記、行內樣式 — 現實世界的 HTML 都能正常解析,不會弄壞輸出。
支援檔案或網址輸入
可以轉換儲存下來的 .html 檔案,也可以用網址抓取線上頁面 — 同一個 API 都能處理。
需要時也能輸出 Markdown
想要結構而不是純文字?同一個端點也能回傳帶標題與清單的 Markdown — 拿掉 output_format=raw 即可。
使用案例
此工具為您節省時間的常見情境。
搜尋索引與 NLP
把頁面的文字內容餵給搜尋引擎和 NLP 模型 — 不讓標記雜訊灌爆索引。
LLM 輸入前處理
原始 HTML 會把 token 浪費在標籤上。先轉成純文字,同樣的 prompt 就能塞進多得多的實際內容。
電子郵件與電子報文字
從 HTML 郵件與電子報中擷取可閱讀的文字,用於封存、引用或製作純文字版本。
爬蟲管線的輸出
把爬蟲收集到的 HTML 轉成乾淨文字,方便儲存與分析 — 每份文件只要一次 API 呼叫。
使用 API 自動化
以程式化方式使用相同工具。適用於任何語言 — 僅需 HTTP。
# Convert an HTML file to plain text curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Convert a live page by URL curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"url": "https://example.com/page"}'
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
params={"output_format": "raw"},
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("page.html", "rb")},
)
print(resp.json()["text"]) # plain text, tags stripped const formData = new FormData();
formData.append("file", htmlFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
{
method: "POST",
headers: { Authorization: "Bearer YOUR_API_KEY" },
body: formData,
}
);
const { text } = await res.json(); // plain text 常見問題
如何把 HTML 轉成純文字?
在上方上傳 .html 檔案或貼上網址 — ParseJet 會移除所有標記並回傳可閱讀的文字。要自動化的話,POST 到 /v1/parse/auto/file 並帶上 output_format=raw。
script 和 CSS 也會被移除嗎?
會。JavaScript、樣式區塊、行內樣式、HTML 註解與追蹤程式碼全部移除 — 一點都不會混進文字輸出。
& 和 這類字元實體會怎麼處理?
它們會被解碼成真正的字元(&、空格、破折號、彎引號等等),所以輸出讀起來就是正常文字,而不是跳脫過的標記。
可以直接轉換線上網頁,而不是檔案嗎?
可以。在工具中貼上頁面網址,或把網址 POST 到 /v1/parse/webpage — ParseJet 會抓取頁面並擷取主要內容轉成文字。
如果我想要 Markdown 而不是純文字呢?
使用同一個端點但不要帶 output_format=raw — ParseJet 會回傳保留標題、清單、表格與連結的 Markdown。可參考我們的 HTML 轉 Markdown 工具。
這是免費的嗎?
是的。無需註冊即可每天免費轉換 3 次,免費 API 帳戶每月包含 300 點數。付費方案每月 19 美元起。
相關工具
HTML to Markdown Converter
Convert HTML to Markdown online for free. Upload an HTML file or paste a URL — get clean Markdown with headings, lists, tables, and links preserved.
URL to Markdown Converter
Convert any URL to clean Markdown online for free. Paste a link and get the page's main content as Markdown — no ads, no navigation. API available.
PDF to Text Converter
Convert PDF to plain text online for free. Handles multi-page documents, scanned PDFs with OCR, and complex layouts. No signup — or automate via API.