HTML转文本转换器
粘贴网址或上传 .html 文件,即可得到去除所有标签、脚本和样式的纯文本。ParseJet 会还原 HTML 实体、保留阅读顺序,输出真正可用的文本 — 免费,无需注册。
拖放文件到此处或 浏览
支持HTML,HTM文件
免费 — 每天3次请求,无需注册。 获取每月300个免费额度。
工作原理
上传 HTML 或粘贴网址
把 .html 文件拖到上方,或粘贴线上页面的网址 — 两种方式产出同样干净的纯文本。
去标签,留文本
ParseJet 解析标记,删除标签、脚本、样式和注释,并把 &、 等实体还原成真实字符。
复制文本
复制纯文本用于搜索索引、NLP 或阅读 — 也可调用 API 在您自己的管道中完成 HTML 转文本。
主要特性
这款html to text脱颖而出的原因。
标签彻底清除
所有 HTML 标签都会被去掉 — 包括脚本、内联样式、埋点像素和注释,只留下人可阅读的文本。
实体还原
&、 、—、’ 等所有实体都会还原成真实字符,输出始终是干净的 UTF-8。
保留阅读顺序
文本按人阅读的顺序输出 — 而不是被布局 div 打乱的 DOM 源码顺序。
杂乱 HTML 也能处理
未闭合标签、层层嵌套的老旧标记、内联样式 — 真实世界的 HTML 都能稳定解析,不会让输出崩坏。
支持文件或网址
既能转换本地保存的 .html 文件,也能按网址抓取线上页面 — 同一个 API 全部搞定。
需要时输出 Markdown
想要结构而不是纯文本?同一个接口去掉 output_format=raw 即可返回带标题和列表的 Markdown。
使用场景
此工具能为您节省时间的常见场景。
搜索索引与 NLP
把页面的文本内容喂给搜索引擎和 NLP 模型 — 不让标记噪音污染索引。
大模型输入预处理
原始 HTML 会把 token 浪费在标签上。先转成纯文本,同样的提示词能装下多得多的正文内容。
邮件与订阅简报文本
从 HTML 邮件和订阅简报中提取可读文本,用于归档、引用或制作纯文本版本。
爬虫管道的输出环节
把爬到的 HTML 转成干净文本用于存储与分析 — 每个文档一次 API 调用。
通过API自动化
以编程方式使用相同的工具。适用于任何语言——仅需HTTP。
# Convert an HTML file to plain text curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=raw" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Convert a live page by URL curl -X POST "https://api.parsejet.com/v1/parse/webpage?output_format=raw" \ -H "Authorization: Bearer YOUR_API_KEY" \ -H "Content-Type: application/json" \ -d '{"url": "https://example.com/page"}'
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
params={"output_format": "raw"},
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("page.html", "rb")},
)
print(resp.json()["text"]) # plain text, tags stripped const formData = new FormData();
formData.append("file", htmlFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=raw",
{
method: "POST",
headers: { Authorization: "Bearer YOUR_API_KEY" },
body: formData,
}
);
const { text } = await res.json(); // plain text 常见问题
HTML 怎么转成纯文本?
在上方上传 .html 文件或粘贴网址 — ParseJet 去除全部标记并返回可读文本。需要自动化时,POST 到 /v1/parse/auto/file 并加上 output_format=raw。
脚本和 CSS 也会被去掉吗?
会。JavaScript、样式块、内联样式、HTML 注释和埋点代码全部清除 — 一点也不会混进文本输出。
&、 这类 HTML 实体会怎么处理?
它们会被还原成真实字符(&、空格、破折号、弯引号等),输出读起来就是正常文本,而不是转义后的标记。
可以直接转换线上网页而不是文件吗?
可以。在工具中粘贴页面网址,或把它 POST 到 /v1/parse/webpage — ParseJet 会抓取页面并把正文提取为文本。
想要 Markdown 而不是纯文本怎么办?
使用同一个接口但不加 output_format=raw — ParseJet 会返回保留标题、列表、表格和链接的 Markdown。参见我们的 HTML转Markdown 工具。
免费吗?
免费。无需注册每天可转换 3 次,注册免费账户每月含 300 积分。付费套餐每月 19 美元起。
相关工具
HTML to Markdown Converter
Convert HTML to Markdown online for free. Upload an HTML file or paste a URL — get clean Markdown with headings, lists, tables, and links preserved.
URL to Markdown Converter
Convert any URL to clean Markdown online for free. Paste a link and get the page's main content as Markdown — no ads, no navigation. API available.
PDF to Text Converter
Convert PDF to plain text online for free. Handles multi-page documents, scanned PDFs with OCR, and complex layouts. No signup — or automate via API.