ParseJet

音频转文字 — 转录任何语音

上传录音文件,立即得到排版清晰、标点规范的文字稿。ParseJet 支持 MP3、WAV、M4A、OGG、FLAC 和 WebM 格式,基于自有服务器的语音识别、自动语言检测、时间戳分段——免费使用,无需注册,开发者也可通过 API 调用获得同样的结果。

拖放文件到此处或 浏览

支持MP3,WAV,M4A,OGG,FLAC,WEBM,AAC文件

免费 — 每天3次请求,无需注册。 获取每月300个免费额度。

工作原理

1

上传音频文件

上传任何录音——语音备忘录、采访、讲座、电话录音。大文件会先在浏览器中压缩,所以即使是 40 MB 的 WAV 也能快速上传。

2

语音识别

系统自动检测语言并在 ParseJet 服务器上进行转录——音频不会被发送给任何第三方 AI 服务。

3

复制文字稿

将文字复制到笔记、文档或提示词中。开发者可通过 API 获得 JSON 格式,包含分段和词级时间戳。

主要特性

这款audio to text脱颖而出的原因。

支持所有常见音频格式

MP3、WAV、M4A、OGG、FLAC、WebM 和 AAC——来自手机、录音机、DAW 或会议工具。

支持数十种语言,自动识别

英语、西班牙语、葡萄牙语、法语、德语、日语、中文、韩语、阿拉伯语、俄语等。短音频可提供语言提示。

易读、标点规范的文字

完整句子、标点符号和段落分行——而非一堆小写单词的混乱文本。

包含时间戳,可生成字幕

每个响应都包含时间分段;API 可提供词级时间戳用于生成 SRT 或 VTT 字幕。

隐私优先设计

识别在 ParseJet 自有服务器上进行。音频在内存中处理,转录完成后立即丢弃。

API 同源引擎

一个 POST 请求上传文件,返回 JSON 结果。提供 Python 和 JavaScript SDK,每月 300 免费额度。

使用场景

此工具能为您节省时间的常见场景。

采访和播客

将一小时的对话转成可搜索、可引用的文字,用于文章、播客文案和研究资料。

会议和通话

转录录音后粘贴到 Claude 或 ChatGPT 生成会议纪要和行动项。

讲座和语音备忘录

课堂录音或随时随地的想法变成可搜索、可编辑的笔记。

字幕和无障碍访问

利用时间分段生成字幕,或在音频旁发布转录文字。

通过API自动化

以编程方式使用相同的工具。适用于任何语言——仅需HTTP。

cURL
# Transcribe a recording (MP3, WAV, M4A, OGG, FLAC, WebM)
curl -X POST https://api.parsejet.com/v1/parse/audio \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]" \
  -F "language=en" \
  -F "with_timestamps=true"

# Response: text + metadata.segments [{start, end, text}] + metadata.words
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/audio",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("interview.mp3", "rb")},
    data={"with_timestamps": "true"},
    timeout=600,
)
data = resp.json()
print(data["text"])                       # the transcript
for seg in data["metadata"]["segments"]:  # timed segments for captions
    print(f'{seg["start"]:.1f}s  {seg["text"]}')
JavaScript
const formData = new FormData();
formData.append("file", audioFile); // MP3, WAV, M4A, OGG, FLAC, WebM
formData.append("with_timestamps", "true");

const res = await fetch("https://api.parsejet.com/v1/parse/audio", {
  method: "POST",
  headers: { Authorization: "Bearer YOUR_API_KEY" },
  body: formData,
});
const { text, metadata } = await res.json();
console.log(text, metadata.segments);

想自动化处理吗?

ParseJet API 通过一个 HTTP 端点提供相同的解析能力。无需 ffmpeg、poppler 或 tesseract — 只需一次 API 调用。

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
查看 API 文档

常见问题

如何将音频文件转录为文字?

上传上方的录音文件等待片刻,文字稿会在输入框下方出现,直接复制即可。每天前三次转录无需账户。如需批量转录,发送 POST 请求到 /v1/parse/audio。

录音最长可以多长?

每次请求最多 5 分钟音频、25 MB 文件大小。如需转录更长的录音:分割文件(大多数编辑器支持按静音点分割)并逐段转录——API 返回时间戳,分段可轻易拼接。

支持哪些语言?

支持数十种语言,包括英语、西班牙语、葡萄牙语、法语、德语、意大利语、荷兰语、波兰语、俄语、土耳其语、阿拉伯语、日语、韩语和中文。系统自动识别,短音频可提供语言提示(language=es)。

转录准确度如何?

清晰的语音和一两个说话者可获得高准确度,包括标点。背景噪声大、说话人多或口音重会降低准确度。无损或高比特率音频帮助不大——语音清晰度比文件格式更重要。

能获得 SRT 格式的字幕吗?

响应包含时间分段,设置 with_timestamps=true 可获得词级时间戳,这是生成 SRT 或 VTT 文件所需的全部信息。一键字幕下载功能即将推出。

录音会上传给第三方吗?

不会。语音识别在 ParseJet 自有服务器上使用开源模型进行。大文件上传前在浏览器中压缩,转录完成后立即删除。

免费吗?

免费。无需注册每天可免费转录 3 次。每次转录需要 3 个积分(最多 5 分钟音频),免费账户每月有 300 个积分。付费计划起价 19 美元/月。

免费开始提取文本

无需注册。几秒钟内解析您的第一个文件。

查看价格