音频转文字 — 转录任何语音
上传录音文件,立即得到排版清晰、标点规范的文字稿。ParseJet 支持 MP3、WAV、M4A、OGG、FLAC 和 WebM 格式,基于自有服务器的语音识别、自动语言检测、时间戳分段——免费使用,无需注册,开发者也可通过 API 调用获得同样的结果。
拖放文件到此处或 浏览
支持MP3,WAV,M4A,OGG,FLAC,WEBM,AAC文件
免费 — 每天3次请求,无需注册。 获取每月300个免费额度。
工作原理
上传音频文件
上传任何录音——语音备忘录、采访、讲座、电话录音。大文件会先在浏览器中压缩,所以即使是 40 MB 的 WAV 也能快速上传。
语音识别
系统自动检测语言并在 ParseJet 服务器上进行转录——音频不会被发送给任何第三方 AI 服务。
复制文字稿
将文字复制到笔记、文档或提示词中。开发者可通过 API 获得 JSON 格式,包含分段和词级时间戳。
主要特性
这款audio to text脱颖而出的原因。
支持所有常见音频格式
MP3、WAV、M4A、OGG、FLAC、WebM 和 AAC——来自手机、录音机、DAW 或会议工具。
支持数十种语言,自动识别
英语、西班牙语、葡萄牙语、法语、德语、日语、中文、韩语、阿拉伯语、俄语等。短音频可提供语言提示。
易读、标点规范的文字
完整句子、标点符号和段落分行——而非一堆小写单词的混乱文本。
包含时间戳,可生成字幕
每个响应都包含时间分段;API 可提供词级时间戳用于生成 SRT 或 VTT 字幕。
隐私优先设计
识别在 ParseJet 自有服务器上进行。音频在内存中处理,转录完成后立即丢弃。
API 同源引擎
一个 POST 请求上传文件,返回 JSON 结果。提供 Python 和 JavaScript SDK,每月 300 免费额度。
使用场景
此工具能为您节省时间的常见场景。
采访和播客
将一小时的对话转成可搜索、可引用的文字,用于文章、播客文案和研究资料。
会议和通话
转录录音后粘贴到 Claude 或 ChatGPT 生成会议纪要和行动项。
讲座和语音备忘录
课堂录音或随时随地的想法变成可搜索、可编辑的笔记。
字幕和无障碍访问
利用时间分段生成字幕,或在音频旁发布转录文字。
通过API自动化
以编程方式使用相同的工具。适用于任何语言——仅需HTTP。
# Transcribe a recording (MP3, WAV, M4A, OGG, FLAC, WebM) curl -X POST https://api.parsejet.com/v1/parse/audio \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" \ -F "language=en" \ -F "with_timestamps=true" # Response: text + metadata.segments [{start, end, text}] + metadata.words
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/audio",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("interview.mp3", "rb")},
data={"with_timestamps": "true"},
timeout=600,
)
data = resp.json()
print(data["text"]) # the transcript
for seg in data["metadata"]["segments"]: # timed segments for captions
print(f'{seg["start"]:.1f}s {seg["text"]}') const formData = new FormData();
formData.append("file", audioFile); // MP3, WAV, M4A, OGG, FLAC, WebM
formData.append("with_timestamps", "true");
const res = await fetch("https://api.parsejet.com/v1/parse/audio", {
method: "POST",
headers: { Authorization: "Bearer YOUR_API_KEY" },
body: formData,
});
const { text, metadata } = await res.json();
console.log(text, metadata.segments); 常见问题
如何将音频文件转录为文字?
上传上方的录音文件等待片刻,文字稿会在输入框下方出现,直接复制即可。每天前三次转录无需账户。如需批量转录,发送 POST 请求到 /v1/parse/audio。
录音最长可以多长?
每次请求最多 5 分钟音频、25 MB 文件大小。如需转录更长的录音:分割文件(大多数编辑器支持按静音点分割)并逐段转录——API 返回时间戳,分段可轻易拼接。
支持哪些语言?
支持数十种语言,包括英语、西班牙语、葡萄牙语、法语、德语、意大利语、荷兰语、波兰语、俄语、土耳其语、阿拉伯语、日语、韩语和中文。系统自动识别,短音频可提供语言提示(language=es)。
转录准确度如何?
清晰的语音和一两个说话者可获得高准确度,包括标点。背景噪声大、说话人多或口音重会降低准确度。无损或高比特率音频帮助不大——语音清晰度比文件格式更重要。
能获得 SRT 格式的字幕吗?
响应包含时间分段,设置 with_timestamps=true 可获得词级时间戳,这是生成 SRT 或 VTT 文件所需的全部信息。一键字幕下载功能即将推出。
录音会上传给第三方吗?
不会。语音识别在 ParseJet 自有服务器上使用开源模型进行。大文件上传前在浏览器中压缩,转录完成后立即删除。
免费吗?
免费。无需注册每天可免费转录 3 次。每次转录需要 3 个积分(最多 5 分钟音频),免费账户每月有 300 个积分。付费计划起价 19 美元/月。
相关工具
MP3 to Text Converter
Convert MP3 to text online for free. Upload an audio file and get an accurate transcript in seconds. MP3, WAV, M4A, OGG, FLAC — or transcribe via API.
WAV to Text Converter
Convert WAV to text online for free. Upload a WAV recording and get an accurate AI transcript in seconds — or transcribe audio at scale via the API.
M4A to Text Converter
Convert M4A to text online for free. Transcribe iPhone Voice Memos and M4A recordings into accurate text in seconds — or automate it via the API.
Video to Text — Transcribe Any Video
Transcribe a video to text online for free. Upload MP4, MOV, MKV, WebM or AVI and get an accurate transcript with timestamps — processed in your browser and on our servers, no signup.