ParseJet

음성 텍스트 변환 — 녹음을 텍스트로 변환

녹음 파일을 업로드하면 몇 초 만에 깔끔하게 정렬된 기록을 얻습니다. ParseJet은 MP3, WAV, M4A, OGG, FLAC, WebM의 음성을 인식하며 저희 서버에서 운영하는 음성 인식 기술을 사용합니다. 수십 개 언어를 지원하고 자동 언어 감지 및 타임스탬프가 포함된 구간이 제공됩니다. 무료로 사용할 수 있으며 가입이 필요 없습니다. 개발자도 API를 통해 동일한 기록을 얻을 수 있습니다.

여기에 파일을 끌어다 놓거나 찾아보기

MP3,WAV,M4A,OGG,FLAC,WEBM,AAC 파일 지원

무료 — 하루 3회 요청, 가입 불필요. 하면 월 300 크레딧 무료.

작동 방식

1

음성 파일 업로드

음성메모, 인터뷰, 강의, 통화 등 어떤 녹음이든 업로드할 수 있습니다. 큰 파일은 브라우저에서 먼저 압축되므로 40MB WAV 파일도 몇 초만에 업로드됩니다.

2

음성 인식

언어는 자동으로 감지되며 음성 인식이 ParseJet 서버에서 처리됩니다. 제3의 AI 서비스로 데이터가 전송되지 않습니다.

3

기록 복사

텍스트를 노트, 문서, 또는 프롬프트에 복사합니다. 개발자는 동일한 결과를 구간 및 단어 타임스탬프가 포함된 JSON 형식으로 받을 수 있습니다.

주요 기능

이 audio to text가 돋보이는 이유.

모든 음성 형식 지원

MP3, WAV, M4A, OGG, FLAC, WebM, AAC를 지원합니다. 휴대폰, 녹음기, DAW, 회의 도구에서 직접 가져옵니다.

수십 개 언어, 자동 감지

영어, 스페인어, 포르투갈어, 프랑스어, 독일어, 일본어, 중국어, 한국어, 아랍어, 러시아어 등을 지원합니다. 짧은 클립에는 언어 힌트를 제공할 수 있습니다.

읽기 좋은 문장 부호 포함 텍스트

문장, 문장 부호, 단락 나누기가 포함되어 있습니다. 소문자만 있는 텍스트가 아닙니다.

자막용 타임스탐프

모든 응답에는 구간별 타임스탐프가 포함되며 API는 SRT 또는 VTT 자막을 위한 단어 레벨 타이밍을 추가할 수 있습니다.

프라이버시 설계

음성 인식이 ParseJet이 운영하는 서버에서 실행됩니다. 음성은 메모리에서 처리되며 기록이 반환된 후 삭제됩니다.

API로도 동일한 엔진

파일을 POST 요청으로 보내면 JSON 형식의 결과를 받습니다. Python 및 JavaScript SDK가 제공되며 월 300개의 무료 크레딧이 포함됩니다.

사용 사례

이 도구가 시간을 절약해주는 일반적인 시나리오.

인터뷰 및 팟캐스트

한 시간의 대화를 검색 가능하고 인용 가능한 텍스트로 변환하여 기사, 쇼 노트, 연구에 활용합니다.

회의 및 통화

녹음을 기록으로 변환한 후 Claude 또는 ChatGPT에 붙여 회의록과 실행 항목을 생성합니다.

강의 및 음성메모

수업이나 외출 중 캡처한 녹음을 검색하고 편집할 수 있는 노트로 변환합니다.

자막 및 접근성

타임스탐프를 사용하여 자막을 제작하거나 음성 옆에 기록을 게시합니다.

API로 자동화

동일한 도구를 프로그래밍 방식으로 사용하세요. 모든 언어와 호환 — 단순히 HTTP입니다.

cURL
# Transcribe a recording (MP3, WAV, M4A, OGG, FLAC, WebM)
curl -X POST https://api.parsejet.com/v1/parse/audio \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]" \
  -F "language=en" \
  -F "with_timestamps=true"

# Response: text + metadata.segments [{start, end, text}] + metadata.words
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/audio",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("interview.mp3", "rb")},
    data={"with_timestamps": "true"},
    timeout=600,
)
data = resp.json()
print(data["text"])                       # the transcript
for seg in data["metadata"]["segments"]:  # timed segments for captions
    print(f'{seg["start"]:.1f}s  {seg["text"]}')
JavaScript
const formData = new FormData();
formData.append("file", audioFile); // MP3, WAV, M4A, OGG, FLAC, WebM
formData.append("with_timestamps", "true");

const res = await fetch("https://api.parsejet.com/v1/parse/audio", {
  method: "POST",
  headers: { Authorization: "Bearer YOUR_API_KEY" },
  body: formData,
});
const { text, metadata } = await res.json();
console.log(text, metadata.segments);

자동화하고 싶으신가요?

ParseJet API는 단일 HTTP 엔드포인트를 통해 동일한 파싱 기능을 제공합니다. ffmpeg, poppler, tesseract 없이 — 단 한 번의 API 호출만으로 가능합니다.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
API 문서 읽기

자주 묻는 질문

음성 파일을 텍스트로 변환하려면 어떻게 해야 하나요?

위에 녹음을 드래그하면 잠시 후 기록이 상자 아래에 나타나며 복사할 수 있습니다. 계정 없이 하루에 처음 3개의 기록은 무료입니다. 대량 처리는 /v1/parse/audio로 파일을 POST하세요.

녹음은 얼마나 길 수 있나요?

요청당 최대 5분의 음성, 파일당 25MB입니다. 더 긴 녹음은 음성 침묵으로 분할하여 부분 기록을 변환하세요. API는 타임스탐프를 반환하므로 조각을 쉽게 연결할 수 있습니다.

어떤 언어를 지원하나요?

영어, 스페인어, 포르투갈어, 프랑스어, 독일어, 이탈리아어, 네덜란드어, 폴란드어, 러시아어, 터키어, 아랍어, 일본어, 한국어, 중국어를 포함한 수십 개 언어를 지원합니다. 언어는 자동으로 감지되며 매우 짧은 클립의 경우 힌트(language=ko)가 도움이 됩니다.

기록의 정확도는 어느 정도인가요?

한두 명의 명확한 음성은 문장 부호를 포함하여 높은 정확도로 기록됩니다. 배경 소음, 중첩 음성, 강한 억양은 정확도를 낮춥니다. 압축되지 않은 또는 고 비트레이트 음성은 크게 도움이 되지 않습니다. 파일 형식보다 음성 명확도가 더 중요합니다.

기록에서 자막(SRT)을 얻을 수 있나요?

응답에는 타임스탐프가 포함되며 with_timestamps=true를 사용하면 단어 타이밍이 추가되므로 SRT 또는 VTT 파일에 필요한 모든 정보가 포함됩니다. 한 번의 클릭으로 자막을 다운로드하는 기능은 계획 중입니다.

녹음이 제3자에게 업로드되나요?

아닙니다. 음성 인식이 ParseJet의 자체 서버에서 오픈소스 모델로 실행됩니다. 큰 파일은 업로드 전에 브라우저에서 압축되며 기록이 반환된 후 음성은 삭제됩니다.

무료인가요?

네. 가입 없이 하루 3개의 기록이 무료입니다. 기록 1개당 3개의 크레딧이 필요하며(최대 5분 음성) 무료 계정에는 월 300개의 크레딧이 포함됩니다. 유료 요금제는 $19/월부터 시작합니다.

무료로 텍스트 추출 시작하기

가입 불필요. 몇 초 만에 첫 파일을 파싱하세요.

가격 보기