ParseJet

PDF OCR — Reconocimiento de Texto para PDFs Escaneados

Un PDF escaneado son solo imágenes de páginas: no puedes buscarlo, seleccionar texto o copiar de él. El PDF OCR de ParseJet renderiza cada página de solo imagen, ejecuta reconocimiento de texto en nuestros propios servidores y devuelve el documento como texto que puedes buscar, copiar y reutilizar. Las páginas que ya tienen una capa de texto se extraen tal cual, por lo que los documentos mixtos salen completos.

Suelta un archivo aquí o explorar

Acepta archivos PDF

Gratis — 3 solicitudes/día, sin registro. para 300 créditos/mes gratis.

Cómo funciona

1

Sube el PDF escaneado

Arrastra el archivo arriba — desde un escáner, una app de escaneo de teléfono o un fax. Los PDFs digitales con una capa de texto también funcionan.

2

Reconocimiento de texto, página por página

ParseJet verifica cada página. Las páginas con texto real se leen directamente; las páginas de solo imagen se renderizan y se pasan a través de OCR.

3

Copia el texto

Copia el documento completo o búscalo como Markdown o texto plano a través de la API para alimentar búsqueda, hojas de cálculo o un LLM.

Características principales

Lo que hace que este pdf ocr destaque.

Detecta qué páginas necesitan OCR

Nada que configurar. Una página con menos de un par de docenas de caracteres extraíbles se trata como un escaneo y se reconoce; todas las otras páginas conservan su texto original.

20+ idiomas

Idiomas de alfabeto latino, chino simplificado y tradicional, y japonés no necesitan configuración. Escaneos en coreano, cirílico, árabe, hindi, tailandés y griego funcionan con una pista de idioma.

Documentos mixtos manejados

Contratos con una página de firma escaneada, informes con escaneos insertados — el texto sale en orden de página con las páginas reconocidas empalmadas.

Nada sale de nuestros servidores

Las páginas se renderizan y reconocen en la infraestructura de ParseJet con modelos de código abierto; ningún servicio de IA de terceros ve tu documento.

Markdown o texto plano

Pide output_format=markdown para conservar encabezados y tablas de las páginas digitales, o raw para texto plano.

Hasta 30 páginas escaneadas por solicitud

Suficiente para la mayoría de cartas, formularios e informes. Escaneos más largos: divide el archivo o procésalo en lotes a través de la API.

Casos de uso

Escenarios comunes donde esta herramienta te ahorra tiempo.

Contratos y facturas archivadas

Haz años de documentos escaneados buscables — extrae el texto una vez e indéxalo.

Documentos escaneados por teléfono

Las apps de escaneo guardan PDFs de solo imagen. Pásalos por OCR para copiar una dirección, una cláusula o un total.

Libros y reportes antiguos

Convierte páginas escaneadas en texto para citar, traducir o herramientas de accesibilidad.

Alimentar escaneos a IA

Claude y ChatGPT no pueden leer una foto de una página confiablemente. OCR primero, luego pega o canaliza el texto.

Automatiza con la API

Usa la misma herramienta de forma programática. Funciona con cualquier lenguaje — solo HTTP.

cURL
# Scanned pages are detected and OCR'd automatically
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...)
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Response metadata tells you which pages were recognized:
# "metadata": { "ocr_pages": [1, 2, 3], ... }
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("scan.pdf", "rb")},
    params={"output_format": "markdown"},
    timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", []))
JavaScript
const formData = new FormData();
formData.append("file", pdfFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
  { method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []);

¿Quieres automatizar esto?

ParseJet API te ofrece el mismo poder de análisis a través de un único endpoint HTTP. Sin ffmpeg, sin poppler, sin tesseract — solo una llamada a la API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Leer Documentación de la API

Preguntas frecuentes

¿Cómo hago OCR a un PDF?

Sube el PDF arriba. ParseJet verifica cada página, reconoce las que son solo imágenes y te muestra el texto completo — usualmente dentro de unos pocos segundos para una carta o formulario típico. Cópialo o llama a la API para hacer lo mismo con muchos archivos.

¿Cómo sé si mi PDF necesita OCR?

Ábrelo e intenta seleccionar una palabra. Si nada se resalta, o hacer zoom hace que las letras se vean pixeladas como una foto, la página es una imagen y necesita OCR. Los PDFs de escáneres, máquinas de fax y apps de escaneo de teléfono casi siempre son así.

¿Obtengo un PDF buscable de vuelta?

Obtienes el texto, no un nuevo archivo PDF. Eso es lo que necesitas para copiar, buscar, indexar, traducir o alimentar un modelo de IA. Si específicamente necesitas el PDF original con una capa de texto invisible agregada, una herramienta de escritorio como OCRmyPDF hace eso.

¿Hay un límite de páginas?

Hasta 30 páginas escaneadas se reconocen por solicitud; las páginas que ya contienen texto no cuentan. Para escaneos más largos, divide el archivo o envíalo en partes vía API. Los metadatos de respuesta listan las páginas que se reconocieron y cualquiera que se saltó.

¿Qué idiomas se soportan?

Inglés y todos los idiomas de alfabeto latino, chino simplificado y tradicional, y japonés funcionan automáticamente. Para coreano, ruso y otros idiomas cirílicos, árabe, hindi, tailandés o griego, pasa language=ko, ru, ar, hi, th o el (las versiones localizadas de esta página lo hacen por ti).

¿Es gratis?

Sí. Tres conversiones gratuitas al día sin registro, 300 créditos al mes con una cuenta gratuita y planes de pago desde $19/mes para archivos más grandes y cuotas más altas.

Comienza a extraer texto gratis

No requiere registro. Analiza tu primer archivo en segundos.

Ver Precios