ParseJet

音檔轉文字──轉錄任何錄音

上傳錄音檔,獲得乾淨、清晰的逐字稿。ParseJet 轉錄 MP3、WAV、M4A、OGG、FLAC 與 WebM 格式,運用自有伺服器上的語音辨識功能──支援數十種語言、自動語言偵測、逐段計時供製作字幕使用。免費試用,無需註冊;同樣的轉錄功能也可透過 API 使用。

將檔案拖放到此處或 瀏覽

接受 MP3,WAV,M4A,OGG,FLAC,WEBM,AAC 檔案

免費 — 每日 3 次請求,無需註冊。 即可獲得每月 300 點免費額度。

運作原理

1

上傳音檔

拖曳或上傳任何錄音──語音備忘錄、訪問、講座、通話。大型檔案會先在瀏覽器中壓縮,所以即使是 40 MB 的 WAV 檔也能快速上傳。

2

語音辨識

系統會自動偵測語言並在 ParseJet 的伺服器上進行轉錄──不會傳送至任何第三方的 AI 服務。

3

複製逐字稿

將文字複製貼上到筆記、文件或提示詞。開發者可透過 API 取得相同的結果,以 JSON 格式提供片段與字詞的時間戳記。

主要功能

這個 audio to text 的突出之處。

支援所有常見音檔格式

MP3、WAV、M4A、OGG、FLAC、WebM 與 AAC──直接來自手機、錄音機、數位音訊工作站或會議工具。

數十種語言,自動辨識

英文、西班牙文、葡萄牙文、法文、德文、日文、中文、韓文、阿拉伯文、俄文等多種語言。短音檔可提供語言提示。

清晰、有標點的文字

完整的句子、正確的標點符號和段落分隔──不是一堆小寫單字。

字幕用的時間戳記

每份回應都包含逐段的計時資訊;API 可加入字詞層級的時間戳記,供製作 SRT 或 VTT 字幕使用。

隱私優先設計

語音辨識在 ParseJet 自有的伺服器上執行。音檔在記憶體中處理,轉錄完成後隨即刪除。

同樣的引擎可透過 API 使用

只需一個 POST 請求附帶檔案,即可取得 JSON 結果。提供 Python 與 JavaScript SDK,每月 300 個免費額度。

使用案例

此工具為您節省時間的常見情境。

訪問和播客

將一小時的對談轉換為可搜尋、可引用的文字,用於文章、節目摘要和研究。

會議和通話

轉錄錄音,然後貼到 Claude 或 ChatGPT,取得會議記錄和待辦事項。

講座和語音備忘錄

課堂或靈感迸發時錄下的內容,變成可搜尋、可編輯的筆記。

字幕與無障礙

使用計時片段製作字幕,或在音檔旁邊發佈逐字稿。

使用 API 自動化

以程式化方式使用相同工具。適用於任何語言 — 僅需 HTTP。

cURL
# Transcribe a recording (MP3, WAV, M4A, OGG, FLAC, WebM)
curl -X POST https://api.parsejet.com/v1/parse/audio \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]" \
  -F "language=en" \
  -F "with_timestamps=true"

# Response: text + metadata.segments [{start, end, text}] + metadata.words
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/audio",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("interview.mp3", "rb")},
    data={"with_timestamps": "true"},
    timeout=600,
)
data = resp.json()
print(data["text"])                       # the transcript
for seg in data["metadata"]["segments"]:  # timed segments for captions
    print(f'{seg["start"]:.1f}s  {seg["text"]}')
JavaScript
const formData = new FormData();
formData.append("file", audioFile); // MP3, WAV, M4A, OGG, FLAC, WebM
formData.append("with_timestamps", "true");

const res = await fetch("https://api.parsejet.com/v1/parse/audio", {
  method: "POST",
  headers: { Authorization: "Bearer YOUR_API_KEY" },
  body: formData,
});
const { text, metadata } = await res.json();
console.log(text, metadata.segments);

想要自動化處理嗎?

ParseJet API 透過單一 HTTP 端點提供相同的解析能力。無需 ffmpeg、poppler 或 tesseract — 只需一次 API 呼叫。

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
閱讀 API 文件

常見問題

如何將音檔轉錄為文字?

拖曳錄音檔到上方框中,稍等一會兒;逐字稿會出現在框下方,你可以複製它。前三筆轉錄無需帳號即可免費使用。如要批次處理,請透過 /v1/parse/audio 端點 POST 檔案。

錄音最長能有多久?

每次請求最多 5 分鐘的音檔,單一檔案最大 25 MB。更長的錄音:分割檔案(大多數編輯軟體都能在無聲處切割),分別轉錄各部分──由於 API 傳回時間戳記,片段會自動銜接。

支援哪些語言?

數十種語言,包括英文、西班牙文、葡萄牙文、法文、德文、義大利文、荷蘭文、波蘭文、俄文、土耳其文、阿拉伯文、日文、韓文與中文。系統會自動偵測語言;對於很短的音檔,提供語言提示(language=es)會很有幫助。

轉錄準確度如何?

單一或兩位講者的清晰語音轉錄準確度很高,包括標點符號。背景雜音多、講者交叉說話或口音厚重會降低準確度。未壓縮或高位元率的音檔幫助不大──語音的清晰度比檔案格式更重要。

能從逐字稿取得字幕(SRT)嗎?

回應中包含逐段的計時資訊,with_timestamps=true 可新增字詞層級的時間戳記,這就是製作 SRT 或 VTT 檔案所需的一切。一鍵字幕下載功能在開發中。

我的錄音會上傳到第三方嗎?

不會。語音辨識在 ParseJet 自有伺服器上執行,採用開源模型。大型檔案上傳前會在瀏覽器中壓縮,音檔在轉錄完成後隨即刪除。

免費嗎?

免費。每天可免費轉錄 3 筆,無需註冊。一筆轉錄需要 3 個額度(最多 5 分鐘音檔);免費帳號包含每月 300 個額度。付費方案起價 $19/月。

免費開始提取文字

無需註冊。幾秒內解析您的第一個檔案。

查看定價