ParseJet

音声 文字起こし — 録音をテキストに変換

音声ファイルをアップロードするだけで、数秒で整った句読点付きのテキスト化が完成します。ParseJet は MP3、WAV、M4A、OGG、FLAC、WebM の音声 文字起こし に対応し、当社のサーバーで動作する音声認識により複数言語に対応、自動言語判定、字幕用タイムスタンプなど様々な機能が使えます。無料で試用でき、登録も不要。API を通じても同じ文字起こし機能が利用できます。

ここにファイルをドロップするか、 参照

MP3,WAV,M4A,OGG,FLAC,WEBM,AACファイルを受け付けます

無料 — 1日3リクエスト、登録不要。 して月300クレジットを無料で。

仕組み

1

音声ファイルをアップロード

音声ファイルをドラッグ&ドロップしてください。ボイスメモ、インタビュー、講義、通話などあらゆる音声に対応しています。大きなファイルはブラウザで圧縮されるため、40MB の WAV でも数秒でアップロード完了です。

2

音声認識で処理

言語は自動検出され、音声は ParseJet のサーバーで文字起こし処理されます。サードパーティの AI サービスには送信されません。

3

テキストをコピー

テキストをノートやドキュメント、プロンプトにコピーできます。開発者向けには、セグメントと単語単位のタイムスタンプ付き JSON も取得できます。

主な機能

このaudio to textが際立つ理由。

あらゆる音声形式に対応

MP3、WAV、M4A、OGG、FLAC、WebM、AAC に対応しており、スマートフォンの音声、レコーダー、DAW、ミーティングツールからの音声をそのまま処理できます。

複数言語に自動対応

英語、スペイン語、ポルトガル語、フランス語、ドイツ語、日本語、中国語、韓国語、アラビア語、ロシア語など多数の言語に対応。自動判定のほか、短い音声には言語ヒントを指定できます。

読みやすく句読点付きのテキスト

単語の羅列ではなく、正しい句読点と段落が入った文章形式で出力されます。

字幕作成用タイムスタンプ

すべてのレスポンスにセグメントのタイミング情報が含まれます。API では単語レベルのタイミングも指定でき、SRT や VTT 字幕ファイルの作成に対応しています。

プライバシーを重視した設計

音声認識は ParseJet が運用するサーバーで実行されます。音声は処理中メモリに保存され、文字起こし完了後は破棄されます。

API でも同じエンジンを利用可能

ファイルを POST で送信すれば JSON で結果が返ります。Python および JavaScript SDK が利用でき、毎月 300 クレジットの無料枠があります。

ユースケース

このツールが時間を節約する一般的なシナリオ。

インタビューとポッドキャスト

1 時間の会話を検索・引用可能なテキストに変換。記事やショーノート、研究資料として活用できます。

会議と通話

会議の録音を文字起こしして、Claude や ChatGPT に貼り付けて議事録と実行項目を作成できます。

講義とボイスメモ

授業や外出先で録音した音声が検索・編集可能なノートに変わります。

字幕とアクセシビリティ

タイムスタンプ情報を活用して字幕を作成したり、音声とともにテキストを公開できます。

APIで自動化

同じツールをプログラムで使用。HTTPのみで、あらゆる言語で動作します。

cURL
# Transcribe a recording (MP3, WAV, M4A, OGG, FLAC, WebM)
curl -X POST https://api.parsejet.com/v1/parse/audio \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]" \
  -F "language=en" \
  -F "with_timestamps=true"

# Response: text + metadata.segments [{start, end, text}] + metadata.words
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/audio",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("interview.mp3", "rb")},
    data={"with_timestamps": "true"},
    timeout=600,
)
data = resp.json()
print(data["text"])                       # the transcript
for seg in data["metadata"]["segments"]:  # timed segments for captions
    print(f'{seg["start"]:.1f}s  {seg["text"]}')
JavaScript
const formData = new FormData();
formData.append("file", audioFile); // MP3, WAV, M4A, OGG, FLAC, WebM
formData.append("with_timestamps", "true");

const res = await fetch("https://api.parsejet.com/v1/parse/audio", {
  method: "POST",
  headers: { Authorization: "Bearer YOUR_API_KEY" },
  body: formData,
});
const { text, metadata } = await res.json();
console.log(text, metadata.segments);

自動化をお求めですか?

ParseJet APIは、単一のHTTPエンドポイントで同じ解析機能を提供します。ffmpeg、poppler、tesseractは不要。APIコール一つだけです。

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
APIドキュメントを読む

よくある質問

音声ファイルをテキストに文字起こしするには?

上の枠に音声ファイルをドロップして、しばらく待つとテキスト化結果が下に表示されます。コピーボタンでテキストをコピーできます。登録なしで 1 日 3 回まで無料で使用できます。一括処理には /v1/parse/audio エンドポイント を使用してください。

音声の最大長は?

1 回のリクエストで最大 5 分、ファイルサイズは最大 25 MB に対応しています。より長い音声は分割して(ほとんどのエディタで無音部分で切断可能)複数に分けて処理してください。API はタイムスタンプを返すため、複数の結果を簡単に結合できます。

対応言語は?

英語、スペイン語、ポルトガル語、フランス語、ドイツ語、イタリア語、オランダ語、ポーランド語、ロシア語、トルコ語、アラビア語、日本語、韓国語、中国語など数十言語に対応しています。言語は自動検出されます。短い音声では language=ja などの言語ヒントを指定することで認識精度が向上します。

文字起こしの精度は?

音の明確な 1~2 人の話者による音声は高い精度で句読点付きで文字起こしされます。背景ノイズが多い、会話が重なっている、アクセントが強い場合は精度が低下します。圧縮されていない高ビットレートの音声でも大幅な改善は期待できません。音声の明瞭さがファイル形式より重要です。

字幕(SRT)を取得できますか?

レスポンスにセグメントのタイミング情報が含まれます。with_timestamps=true を指定すると単語レベルのタイミングも追加されます。これが SRT または VTT ファイルに必要なすべての情報です。ワンクリック字幕ダウンロード機能はロードマップに含まれています。

音声をサードパーティにアップロードされませんか?

いいえ。音声認識は ParseJet 自社のサーバーでオープンソースモデルを使用して実行されます。大きなファイルはアップロード前にブラウザで圧縮され、文字起こし完了後に音声は破棄されます。

無料ですか?

はい。登録なしで 1 日 3 回まで無料です。1 回の文字起こしは 3 クレジット(最大 5 分の音声)です。無料枠は毎月 300 クレジット。有料プランは月 19 ドルからです。

無料でテキスト抽出を始める

サインアップ不要。数秒で最初のファイルを解析。

料金を見る