ParseJet

HTML转文本转换器

粘贴网址或上传 .html 文件,即可得到去除所有标签、脚本和样式的纯文本。ParseJet 会还原 HTML 实体、保留阅读顺序,输出真正可用的文本 — 免费,无需注册。

拖放文件到此处或 浏览

支持HTML,HTM文件

免费 — 每天3次请求,无需注册。 获取每月300个免费额度。

工作原理

1

上传 HTML 或粘贴网址

把 .html 文件拖到上方,或粘贴线上页面的网址 — 两种方式产出同样干净的纯文本。

2

去标签,留文本

ParseJet 解析标记,删除标签、脚本、样式和注释,并把 &、  等实体还原成真实字符。

3

复制文本

复制纯文本用于搜索索引、NLP 或阅读 — 也可调用 API 在您自己的管道中完成 HTML 转文本。

主要特性

这款html to text脱颖而出的原因。

标签彻底清除

所有 HTML 标签都会被去掉 — 包括脚本、内联样式、埋点像素和注释,只留下人可阅读的文本。

实体还原

&、 、—、’ 等所有实体都会还原成真实字符,输出始终是干净的 UTF-8。

保留阅读顺序

文本按人阅读的顺序输出 — 而不是被布局 div 打乱的 DOM 源码顺序。

杂乱 HTML 也能处理

未闭合标签、层层嵌套的老旧标记、内联样式 — 真实世界的 HTML 都能稳定解析,不会让输出崩坏。

支持文件或网址

既能转换本地保存的 .html 文件,也能按网址抓取线上页面 — 同一个 API 全部搞定。

需要时输出 Markdown

想要结构而不是纯文本?同一个接口去掉 output_format=raw 即可返回带标题和列表的 Markdown。

使用场景

此工具能为您节省时间的常见场景。

搜索索引与 NLP

把页面的文本内容喂给搜索引擎和 NLP 模型 — 不让标记噪音污染索引。

大模型输入预处理

原始 HTML 会把 token 浪费在标签上。先转成纯文本,同样的提示词能装下多得多的正文内容。

邮件与订阅简报文本

从 HTML 邮件和订阅简报中提取可读文本,用于归档、引用或制作纯文本版本。

爬虫管道的输出环节

把爬到的 HTML 转成干净文本用于存储与分析 — 每个文档一次 API 调用。

通过API自动化

以编程方式使用相同的工具。适用于任何语言——仅需HTTP。

cURL
# Convert an HTML file to plain text
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Convert a live page by URL
curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://example.com/page"}'
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    params={"output_format": "raw"},
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("page.html", "rb")},
)
print(resp.json()["text"])  # plain text, tags stripped
JavaScript
const formData = new FormData();
formData.append("file", htmlFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
  {
    method: "POST",
    headers: { Authorization: "Bearer YOUR_API_KEY" },
    body: formData,
  }
);
const { text } = await res.json(); // plain text

想自动化处理吗?

ParseJet API 通过一个 HTTP 端点提供相同的解析能力。无需 ffmpeg、poppler 或 tesseract — 只需一次 API 调用。

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
查看 API 文档

常见问题

HTML 怎么转成纯文本?

在上方上传 .html 文件或粘贴网址 — ParseJet 去除全部标记并返回可读文本。需要自动化时,POST 到 /v1/parse/auto/file 并加上 output_format=raw。

脚本和 CSS 也会被去掉吗?

会。JavaScript、样式块、内联样式、HTML 注释和埋点代码全部清除 — 一点也不会混进文本输出。

&、  这类 HTML 实体会怎么处理?

它们会被还原成真实字符(&、空格、破折号、弯引号等),输出读起来就是正常文本,而不是转义后的标记。

可以直接转换线上网页而不是文件吗?

可以。在工具中粘贴页面网址,或把它 POST 到 /v1/parse/webpage — ParseJet 会抓取页面并把正文提取为文本。

想要 Markdown 而不是纯文本怎么办?

使用同一个接口但不加 output_format=raw — ParseJet 会返回保留标题、列表、表格和链接的 Markdown。参见我们的 HTML转Markdown 工具。

免费吗?

免费。无需注册每天可转换 3 次,注册免费账户每月含 300 积分。付费套餐每月 19 美元起。

免费开始提取文本

无需注册。几秒钟内解析您的第一个文件。

查看价格