ParseJet

Audio in Text umwandeln — Jede Aufnahme

Laden Sie eine Aufnahme hoch und erhalten Sie ein sauberes, richtig gepunktetes Transkript in Sekunden. ParseJet transkribiert MP3, WAV, M4A, OGG, FLAC und WebM mit Spracherkennung auf eigenen Servern — 40+ Sprachen, automatische Spracherkennung, zeitgesteuerte Segmente für Untertitel. Kostenlos ausprobieren, keine Anmeldung; die gleiche Transkription ist über die API verfügbar.

Datei hier ablegen oder durchsuchen

Akzeptiert MP3,WAV,M4A,OGG,FLAC,WEBM,AAC Dateien

Kostenlos — 3 Anfragen/Tag, keine Anmeldung. für 300 Credits/Monat kostenlos.

So funktioniert es

1

Laden Sie Ihre Aufnahme hoch

Ziehen Sie eine beliebige Aufnahme hin — Sprachmemo, Interview, Vorlesung, Telefonat. Große Dateien werden zunächst in Ihrem Browser komprimiert, sodass auch eine 40-MB-WAV-Datei in Sekunden hochgeladen wird.

2

Spracherkennung

Die Sprache wird automatisch erkannt und die Sprache auf ParseJets Servern transkribiert — nichts wird an einen Drittanbieter-KI-Dienst gesendet.

3

Kopieren Sie Ihr Transkript

Kopieren Sie den Text in Notizen, Dokumente oder einen Prompt. Entwickler erhalten das gleiche Ergebnis als JSON mit Segment- und Wort-Zeitstempeln.

Hauptfunktionen

Was dieses audio to text auszeichnet.

Alle gängigen Audioformate

MP3, WAV, M4A, OGG, FLAC, WebM und AAC — direkt von einem Telefon, einem Rekorder, einer DAW oder einem Meeting-Tool.

40+ Sprachen, automatisch erkannt

Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Japanisch, Chinesisch, Koreanisch, Arabisch, Russisch und viele weitere. Geben Sie einen Sprachhint für kurze Clips an.

Lesbarer, korrekt gepunkteter Text

Sätze, Interpunktion und Absatzumbrüche bei Pausen — nicht ein Haufen Kleinbuchstaben.

Zeitstempel für Untertitel

Jede Antwort enthält zeitgesteuerte Segmente; die API kann Wort-Zeitstempel für SRT- oder VTT-Untertitel hinzufügen.

Datenschutz nach Entwurf

Die Erkennung läuft auf Servern, die ParseJet betreibt. Audio wird im Speicher verarbeitet und nach Rückgabe des Transkripts verworfen.

Gleiches Verfahren über API

Ein POST mit der Datei, JSON zurück. Python- und JavaScript-SDKs, 300 kostenlose Credits pro Monat.

Anwendungsfälle

Häufige Szenarien, in denen dieses Tool Zeit spart.

Interviews und Podcasts

Wandeln Sie eine Stunde Gespräch in durchsuchbaren, zitierfähigen Text für Artikel, Show Notes und Recherche um.

Besprechungen und Anrufe

Transkribieren Sie die Aufnahme und fügen Sie sie dann in Claude oder ChatGPT ein, um Notizen und Maßnahmen zu erhalten.

Vorlesungen und Sprachmemos

Aufnahmen aus dem Unterricht oder unterwegs aufgenommene Ideen werden zu durchsuchbaren und bearbeitbaren Notizen.

Untertitel und Barrierefreiheit

Verwenden Sie die zeitgesteuerten Segmente, um Untertitel zu erstellen, oder veröffentlichen Sie das Transkript neben dem Audio.

Mit der API automatisieren

Nutzen Sie dasselbe Tool programmatisch. Funktioniert mit jeder Sprache – einfach HTTP.

cURL
# Transcribe a recording (MP3, WAV, M4A, OGG, FLAC, WebM)
curl -X POST https://api.parsejet.com/v1/parse/audio \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]" \
  -F "language=en" \
  -F "with_timestamps=true"

# Response: text + metadata.segments [{start, end, text}] + metadata.words
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/audio",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("interview.mp3", "rb")},
    data={"with_timestamps": "true"},
    timeout=600,
)
data = resp.json()
print(data["text"])                       # the transcript
for seg in data["metadata"]["segments"]:  # timed segments for captions
    print(f'{seg["start"]:.1f}s  {seg["text"]}')
JavaScript
const formData = new FormData();
formData.append("file", audioFile); // MP3, WAV, M4A, OGG, FLAC, WebM
formData.append("with_timestamps", "true");

const res = await fetch("https://api.parsejet.com/v1/parse/audio", {
  method: "POST",
  headers: { Authorization: "Bearer YOUR_API_KEY" },
  body: formData,
});
const { text, metadata } = await res.json();
console.log(text, metadata.segments);

Möchten Sie dies automatisieren?

Die ParseJet API bietet Ihnen die gleiche Parsing-Leistung über einen einzigen HTTP-Endpunkt. Kein ffmpeg, kein poppler, kein tesseract — nur ein API-Aufruf.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
API-Dokumentation lesen

Häufig gestellte Fragen

Wie transkribiere ich eine Audiodatei in Text?

Ziehen Sie die Aufnahme oben hin und warten Sie einen Moment; das Transkript wird unter dem Feld angezeigt und Sie können es kopieren. Für die erste drei Transkriptionen pro Tag ist kein Konto erforderlich. Für Batches senden Sie die Dateien an /v1/parse/audio.

Wie lange kann die Aufnahme sein?

Bis zu 5 Minuten Audio pro Anfrage und 25 MB pro Datei. Bei längeren Aufnahmen: teilen Sie sie auf (die meisten Editoren können bei Stille schneiden) und transkribieren Sie die Teile — die API gibt Zeitstempel zurück, sodass die Teile zusammenpassen.

Welche Sprachen werden unterstützt?

Dutzende, darunter Englisch, Spanisch, Portugiesisch, Französisch, Deutsch, Italienisch, Niederländisch, Polnisch, Russisch, Türkisch, Arabisch, Japanisch, Koreanisch und Chinesisch. Die Sprache wird automatisch erkannt; ein Hinweis (language=de) hilft bei sehr kurzen Clips.

Wie genau ist die Transkription?

Klare Sprache von ein oder zwei Sprechern wird mit hoher Genauigkeit transkribiert, einschließlich Interpunktion. Starker Hintergrundlärm, Durcheinander und starke Akzente verringern sie. Unkomprimiertes oder hochbitraten Audio hilft nicht viel — die Klarheit der Sprache ist wichtiger als das Dateiformat.

Kann ich Untertitel (SRT) vom Transkript bekommen?

Die Antwort enthält zeitgesteuerte Segmente, und with_timestamps=true fügt Wort-Zeitstempel hinzu, was alles ist, was eine SRT- oder VTT-Datei benötigt. Ein One-Click-Untertitel-Download ist auf der Roadmap.

Wird meine Aufnahme an Dritte hochgeladen?

Nein. Die Spracherkennung läuft auf ParseJets eigenen Servern mit Open-Source-Modellen. Große Dateien werden vor dem Upload in Ihrem Browser komprimiert und das Audio wird nach Rückgabe des Transkripts verworfen.

Ist es kostenlos?

Ja. Drei kostenlose Transkriptionen pro Tag ohne Anmeldung. Eine Transkription kostet 3 Credits (bis zu 5 Minuten Audio); das kostenlose Konto umfasst 300 Credits pro Monat. Kostenpflichtige Pläne beginnen bei 19 $/Monat.

Kostenlos mit Textextraktion starten

Keine Anmeldung erforderlich. Parsen Sie Ihre erste Datei in Sekunden.

Preise ansehen