ParseJet

Audio na tekst — transkrybuj każde nagranie

Prześlij nagranie i uzyskaj czysty, poprawnie interpunkcyjny transkrypt w sekundy. ParseJet transkrybuje pliki MP3, WAV, M4A, OGG, FLAC i WebM za pomocą rozpoznawania mowy działającego na naszych własnych serwerach — dziesiątki języków, automatyczne rozpoznawanie języka, segmenty czasowe do napisów. Całkowicie darmowe, bez rejestracji; ten sam transkrypt jest dostępny przez API.

Upuść plik tutaj lub przeglądaj

Akceptuje pliki MP3,WAV,M4A,OGG,FLAC,WEBM,AAC

Darmowe — 3 żądania/dzień, bez rejestracji. za 300 kredytów/miesiąc za darmo.

Jak to działa

1

Prześlij swoje audio

Upuść dowolne nagranie powyżej — notkę głosową, wywiad, wykład, połączenie. Duże pliki są najpierw kompresowane w przeglądarce, więc nawet plik WAV o rozmiarze 40 MB przesyła się w sekundy.

2

rozpoznawanie mowy

Język jest automatycznie rozpoznawany, a mowa transkrybowana na serwerach ParseJet — nic nie trafia do serwisu AI strony trzeciej.

3

skopiuj transkrypt

Skopiuj tekst do notatek, dokumentów lub prompta. Programiści otrzymują ten sam wynik jako JSON ze znacznikami czasu segmentów i słów.

Kluczowe funkcje

Co wyróżnia to audio to text.

każdy popularny format audio

MP3, WAV, M4A, OGG, FLAC, WebM i AAC — bezpośrednio z telefonu, dyktafonu, DAW-a czy narzędzia konferencyjnego.

dziesiątki języków, automatyczne wykrycie

Angielski, hiszpański, portugalski, francuski, niemiecki, japoński, chiński, koreański, arabski, rosyjski i wiele innych. Dodaj wskazówkę o języku dla krótkich klipów.

czysty, interpunkcyjny tekst

Zdania, znaki interpunkcyjne i podziały akapitów na pauzach — nie ściana małych liter.

znaczniki czasu do napisów

Każda odpowiedź zawiera segmenty czasowe; API może dodać znaczniki czasu na poziomie słowa dla napisów SRT lub VTT.

prywatne z założenia

Rozpoznawanie działa na serwerach ParseJet. Audio jest przetwarzane w pamięci i usuwane po zwróceniu transkryptu.

ten sam silnik przez API

Jeden POST z plikiem, JSON w odpowiedzi. Dostępne SDK dla Pythona i JavaScriptu, 300 darmowych punktów miesięcznie.

Przykłady zastosowań

Typowe scenariusze, w których to narzędzie oszczędza czas.

wywiady i podcasty

Zamień godzinę rozmowy na przeszukiwalny, cytowalny tekst dla artykułów, notek do odcinków i badań.

spotkania i połączenia

Transkrybuj nagranie, a następnie wklej je do Claude lub ChatGPT, aby uzyskać notatki i punkty działań.

wykłady i notatki głosowe

Nagrania z klasy lub pomysły chwycone w locie stają się notatkami, które możesz przeszukiwać i edytować.

napisy i dostępność

Użyj segmentów czasowych do tworzenia napisów lub opublikuj transkrypt obok audio.

Automatyzuj za pomocą API

Użyj tego samego narzędzia programistycznie. Działa z dowolnym językiem — wystarczy HTTP.

cURL
# Transcribe a recording (MP3, WAV, M4A, OGG, FLAC, WebM)
curl -X POST https://api.parsejet.com/v1/parse/audio \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]" \
  -F "language=en" \
  -F "with_timestamps=true"

# Response: text + metadata.segments [{start, end, text}] + metadata.words
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/audio",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("interview.mp3", "rb")},
    data={"with_timestamps": "true"},
    timeout=600,
)
data = resp.json()
print(data["text"])                       # the transcript
for seg in data["metadata"]["segments"]:  # timed segments for captions
    print(f'{seg["start"]:.1f}s  {seg["text"]}')
JavaScript
const formData = new FormData();
formData.append("file", audioFile); // MP3, WAV, M4A, OGG, FLAC, WebM
formData.append("with_timestamps", "true");

const res = await fetch("https://api.parsejet.com/v1/parse/audio", {
  method: "POST",
  headers: { Authorization: "Bearer YOUR_API_KEY" },
  body: formData,
});
const { text, metadata } = await res.json();
console.log(text, metadata.segments);

Chcesz to zautomatyzować?

ParseJet API daje Ci tę samą moc parsowania przez jeden punkt końcowy HTTP. Bez ffmpeg, bez poppler, bez tesseract — tylko jedno wywołanie API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Przeczytaj dokumentację API

Często zadawane pytania

Jak transkrybuję plik audio na tekst?

Upuść nagranie powyżej i czekaj chwilę; transkrypt pojawi się poniżej pola i możesz go skopiować. Pierwsze trzy transkrypcje dziennie są darmowe bez konta. W przypadku partii prześlij pliki do /v1/parse/audio.

Jak długo może być nagranie?

Do 5 minut audio na żądanie i 25 MB na plik. Dłuższe nagrania: podziel je (większość edytorów umożliwia cięcie na ciszy) i transkrybuj części — API zwraca znaczniki czasu, dzięki czemu części się łączą.

Które języki są obsługiwane?

Dziesiątki, w tym angielski, hiszrański, portugalski, francuski, niemiecki, włoski, holenderski, polski, rosyjski, turecki, arabski, japoński, koreański i chiński. Język jest automatycznie rozpoznawany; wskazówka (language=es) pomaga na bardzo krótkich klipach.

Jak dokładna jest transkrypcja?

Wyraźna mowa od jednego lub dwóch mówiących transkrybuje się z wysoką dokładnością, łącznie z interpunkcją. Silny szum w tle, nakładający się dialog i mocne akcenty ją obniżają. Nieskompresowane lub wysokobitowe audio nie pomaga wiele — czytelność mowy jest ważniejsza niż format pliku.

Czy mogę uzyskać napisy (SRT) z transkryptu?

Odpowiedź zawiera segmenty czasowe, a with_timestamps=true dodaje znaczniki czasu słowa, co jest wszystkim, czego potrzebuje plik SRT lub VTT. Pobieranie napisów jednym klikiem znajduje się na mapie drogowej.

Czy moje nagranie jest przesyłane do strony trzeciej?

Nie. Rozpoznawanie mowy działa na serwerach ParseJet z modelami open-source. Duże pliki są kompresowane w przeglądarce przed przesłaniem, a audio jest usuwane po zwróceniu transkryptu.

Czy to jest darmowe?

Tak. Trzy darmowe transkrypcje dziennie bez rejestracji. Transkrypcja kosztuje 3 punkty (do 5 minut audio); darmowe konto zawiera 300 punktów miesięcznie. Plany płatne zaczynają się od 19 zł/miesiąc.

Zacznij bezpłatnie wyodrębniać tekst

Bez rejestracji. Przeanalizuj swój pierwszy plik w kilka sekund.

Zobacz cennik