ParseJet

Transcribir audio a texto — Convierte cualquier grabación

Sube una grabación y obtén una transcripción limpia y puntuada en segundos. ParseJet transcribe MP3, WAV, M4A, OGG, FLAC y WebM con reconocimiento de voz que se ejecuta en nuestros propios servidores — docenas de idiomas, detección automática del idioma, segmentos cronometrados para subtítulos. Es gratis y no necesitas cuenta; el mismo reconocimiento está disponible a través de la API.

Suelta un archivo aquí o explorar

Acepta archivos MP3,WAV,M4A,OGG,FLAC,WEBM,AAC

Gratis — 3 solicitudes/día, sin registro. para 300 créditos/mes gratis.

Cómo funciona

1

Sube tu audio

Arrastra cualquier grabación — una nota de voz, una entrevista, una conferencia, una llamada. Los archivos grandes se comprimen en tu navegador primero, así que incluso un WAV de 40 MB se sube en segundos.

2

Reconocimiento de voz

El idioma se detecta automáticamente y la voz se transcribe en los servidores de ParseJet — nada se envía a un servicio de IA de terceros.

3

Copia tu transcripción

Copia el texto a tus notas, documentos o un prompt. Los desarrolladores obtienen el mismo resultado como JSON con timestamps de segmentos y palabras.

Características principales

Lo que hace que este audio to text destaque.

Todos los formatos de audio comunes

MP3, WAV, M4A, OGG, FLAC, WebM y AAC — directo de un teléfono, una grabadora, una DAW o una herramienta de reuniones.

Docenas de idiomas, detectados automáticamente

Inglés, español, portugués, francés, alemán, japonés, chino, coreano, árabe, ruso y muchos más. Pasa una pista de idioma para clips cortos.

Texto legible y puntuado

Oraciones, puntuación y saltos de párrafo en las pausas — no una pared de palabras en minúsculas.

Timestamps para subtítulos

Cada respuesta incluye segmentos cronometrados; la API puede agregar timestamps a nivel de palabra para subtítulos SRT o VTT.

Privado por diseño

El reconocimiento se ejecuta en servidores que opera ParseJet. El audio se procesa en memoria y se descarta una vez que se devuelve la transcripción.

Mismo motor a través de la API

Un POST con el archivo, JSON de vuelta. SDKs para Python y JavaScript, 300 créditos gratis al mes.

Casos de uso

Escenarios comunes donde esta herramienta te ahorra tiempo.

Entrevistas y podcasts

Convierte una hora de conversación en texto buscable y citable para artículos, notas del programa e investigación.

Reuniones y llamadas

Transcribe la grabación y luego pégala en Claude o ChatGPT para actas e elementos de acción.

Conferencias y notas de voz

Las grabaciones de clase o ideas capturadas sobre la marcha se convierten en notas que puedes buscar y editar.

Subtítulos y accesibilidad

Usa los segmentos cronometrados para producir subtítulos, o publica la transcripción junto al audio.

Automatiza con la API

Usa la misma herramienta de forma programática. Funciona con cualquier lenguaje — solo HTTP.

cURL
# Transcribe a recording (MP3, WAV, M4A, OGG, FLAC, WebM)
curl -X POST https://api.parsejet.com/v1/parse/audio \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]" \
  -F "language=en" \
  -F "with_timestamps=true"

# Response: text + metadata.segments [{start, end, text}] + metadata.words
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/audio",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("interview.mp3", "rb")},
    data={"with_timestamps": "true"},
    timeout=600,
)
data = resp.json()
print(data["text"])                       # the transcript
for seg in data["metadata"]["segments"]:  # timed segments for captions
    print(f'{seg["start"]:.1f}s  {seg["text"]}')
JavaScript
const formData = new FormData();
formData.append("file", audioFile); // MP3, WAV, M4A, OGG, FLAC, WebM
formData.append("with_timestamps", "true");

const res = await fetch("https://api.parsejet.com/v1/parse/audio", {
  method: "POST",
  headers: { Authorization: "Bearer YOUR_API_KEY" },
  body: formData,
});
const { text, metadata } = await res.json();
console.log(text, metadata.segments);

¿Quieres automatizar esto?

ParseJet API te ofrece el mismo poder de análisis a través de un único endpoint HTTP. Sin ffmpeg, sin poppler, sin tesseract — solo una llamada a la API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Leer Documentación de la API

Preguntas frecuentes

¿Cómo transcribo audio a texto?

Arrastra la grabación arriba y espera un momento; la transcripción aparece debajo de la caja y puedes copiarla. No necesitas una cuenta para las primeras tres transcripciones al día. Para lotes, envía los archivos a /v1/parse/audio.

¿Cuánto tiempo puede durar la grabación?

Hasta 5 minutos de audio por solicitud y 25 MB por archivo. Grabaciones más largas: divídelas (la mayoría de editores pueden cortar en silencio) y transcribe las partes — la API devuelve timestamps, así que las piezas se alinean.

¿Qué idiomas son compatibles?

Docenas, incluyendo inglés, español, portugués, francés, alemán, italiano, holandés, polaco, ruso, turco, árabe, japonés, coreano y chino. El idioma se detecta automáticamente; una pista (language=es) ayuda en clips muy cortos.

¿Cuán precisa es la transcripción?

El habla clara de una o dos personas se transcribe con alta precisión, incluyendo puntuación. El ruido de fondo fuerte, el cruce de voces y los acentos cerrados la bajan. El audio sin comprimir o de alta velocidad de bits no ayuda mucho — la claridad del habla importa más que el formato del archivo.

¿Puedo obtener subtítulos (SRT) de la transcripción?

La respuesta incluye segmentos cronometrados, y with_timestamps=true agrega timestamps de palabras, que es todo lo que un archivo SRT o VTT necesita. Una descarga de subtítulos de un clic está en el plan.

¿Se sube mi grabación a un tercero?

No. El reconocimiento de voz se ejecuta en los servidores propios de ParseJet con modelos de código abierto. Los archivos grandes se comprimen en tu navegador antes de la carga, y el audio se descarta una vez que se devuelve la transcripción.

¿Es gratis?

Sí. Tres transcripciones gratis al día sin registro. Una transcripción cuesta 3 créditos (hasta 5 minutos de audio); la cuenta gratis incluye 300 créditos al mes. Los planes pagos comienzan en $19/mes.

Comienza a extraer texto gratis

No requiere registro. Analiza tu primer archivo en segundos.

Ver Precios