ParseJet

HTML 轉純文字工具

貼上網址或上傳 .html 檔案,就能取得乾淨的純文字 — 所有標籤、script 與樣式全部移除。ParseJet 會解碼 HTML 字元實體、保留閱讀順序,回傳真正可以直接使用的文字 — 免費,無需註冊。

將檔案拖放到此處或 瀏覽

接受 HTML,HTM 檔案

免費 — 每日 3 次請求,無需註冊。 即可獲得每月 300 點免費額度。

運作原理

1

上傳 HTML 或貼上網址

將 .html 檔案拖曳至上方,或貼上線上頁面的網址 — 兩種方式都會產生同樣乾淨的純文字輸出。

2

移除標籤、留下文字

ParseJet 會解析標記,移除標籤、script、樣式與註解,並把 &、  等字元實體解碼成真正的字元。

3

複製您的文字

複製純文字拿去做搜尋索引、NLP 或閱讀 — 或呼叫 API,在您自己的管線裡把 HTML 轉成文字。

主要功能

這個 html to text 的突出之處。

標籤完全移除

每一個 HTML 標籤都會被清掉 — 包括 script、行內樣式、追蹤像素與註解。只留下人類可閱讀的文字。

字元實體解碼

&、 、—、’ 等所有字元實體都會解碼成真正的字元。輸出一律是乾淨的 UTF-8。

保留閱讀順序

文字會依照人實際閱讀的順序輸出 — 而不是被版面 div 打亂的 DOM 原始碼順序。

雜亂的 HTML 也能處理

未關閉的標籤、層層巢狀的老舊標記、行內樣式 — 現實世界的 HTML 都能正常解析,不會弄壞輸出。

支援檔案或網址輸入

可以轉換儲存下來的 .html 檔案,也可以用網址抓取線上頁面 — 同一個 API 都能處理。

需要時也能輸出 Markdown

想要結構而不是純文字?同一個端點也能回傳帶標題與清單的 Markdown — 拿掉 output_format=raw 即可。

使用案例

此工具為您節省時間的常見情境。

搜尋索引與 NLP

把頁面的文字內容餵給搜尋引擎和 NLP 模型 — 不讓標記雜訊灌爆索引。

LLM 輸入前處理

原始 HTML 會把 token 浪費在標籤上。先轉成純文字,同樣的 prompt 就能塞進多得多的實際內容。

電子郵件與電子報文字

從 HTML 郵件與電子報中擷取可閱讀的文字,用於封存、引用或製作純文字版本。

爬蟲管線的輸出

把爬蟲收集到的 HTML 轉成乾淨文字,方便儲存與分析 — 每份文件只要一次 API 呼叫。

使用 API 自動化

以程式化方式使用相同工具。適用於任何語言 — 僅需 HTTP。

cURL
# Convert an HTML file to plain text
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Convert a live page by URL
curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/page"}'
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    params={"output_format": "raw"},
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("page.html", "rb")},
)
print(resp.json()["text"])  # plain text, tags stripped
JavaScript
const formData = new FormData();
formData.append("file", htmlFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
  {
    method: "POST",
    headers: { Authorization: "Bearer YOUR_API_KEY" },
    body: formData,
  }
);
const { text } = await res.json(); // plain text

想要自動化處理嗎?

ParseJet API 透過單一 HTTP 端點提供相同的解析能力。無需 ffmpeg、poppler 或 tesseract — 只需一次 API 呼叫。

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
閱讀 API 文件

常見問題

如何把 HTML 轉成純文字?

在上方上傳 .html 檔案或貼上網址 — ParseJet 會移除所有標記並回傳可閱讀的文字。要自動化的話,POST 到 /v1/parse/auto/file 並帶上 output_format=raw。

script 和 CSS 也會被移除嗎?

會。JavaScript、樣式區塊、行內樣式、HTML 註解與追蹤程式碼全部移除 — 一點都不會混進文字輸出。

& 和   這類字元實體會怎麼處理?

它們會被解碼成真正的字元(&、空格、破折號、彎引號等等),所以輸出讀起來就是正常文字,而不是跳脫過的標記。

可以直接轉換線上網頁,而不是檔案嗎?

可以。在工具中貼上頁面網址,或把網址 POST 到 /v1/parse/webpage — ParseJet 會抓取頁面並擷取主要內容轉成文字。

如果我想要 Markdown 而不是純文字呢?

使用同一個端點但不要帶 output_format=raw — ParseJet 會回傳保留標題、清單、表格與連結的 Markdown。可參考我們的 HTML 轉 Markdown 工具。

這是免費的嗎?

是的。無需註冊即可每天免費轉換 3 次,免費 API 帳戶每月包含 300 點數。付費方案每月 19 美元起。

免費開始提取文字

無需註冊。幾秒內解析您的第一個檔案。

查看定價