PDF OCR — Reconocimiento de Texto para PDFs Escaneados
Un PDF escaneado son solo imágenes de páginas: no puedes buscarlo, seleccionar texto o copiar de él. El PDF OCR de ParseJet renderiza cada página de solo imagen, ejecuta reconocimiento de texto en nuestros propios servidores y devuelve el documento como texto que puedes buscar, copiar y reutilizar. Las páginas que ya tienen una capa de texto se extraen tal cual, por lo que los documentos mixtos salen completos.
Suelta un archivo aquí o explorar
Acepta archivos PDF
Gratis — 3 solicitudes/día, sin registro. para 300 créditos/mes gratis.
Cómo funciona
Sube el PDF escaneado
Arrastra el archivo arriba — desde un escáner, una app de escaneo de teléfono o un fax. Los PDFs digitales con una capa de texto también funcionan.
Reconocimiento de texto, página por página
ParseJet verifica cada página. Las páginas con texto real se leen directamente; las páginas de solo imagen se renderizan y se pasan a través de OCR.
Copia el texto
Copia el documento completo o búscalo como Markdown o texto plano a través de la API para alimentar búsqueda, hojas de cálculo o un LLM.
Características principales
Lo que hace que este pdf ocr destaque.
Detecta qué páginas necesitan OCR
Nada que configurar. Una página con menos de un par de docenas de caracteres extraíbles se trata como un escaneo y se reconoce; todas las otras páginas conservan su texto original.
20+ idiomas
Idiomas de alfabeto latino, chino simplificado y tradicional, y japonés no necesitan configuración. Escaneos en coreano, cirílico, árabe, hindi, tailandés y griego funcionan con una pista de idioma.
Documentos mixtos manejados
Contratos con una página de firma escaneada, informes con escaneos insertados — el texto sale en orden de página con las páginas reconocidas empalmadas.
Nada sale de nuestros servidores
Las páginas se renderizan y reconocen en la infraestructura de ParseJet con modelos de código abierto; ningún servicio de IA de terceros ve tu documento.
Markdown o texto plano
Pide output_format=markdown para conservar encabezados y tablas de las páginas digitales, o raw para texto plano.
Hasta 30 páginas escaneadas por solicitud
Suficiente para la mayoría de cartas, formularios e informes. Escaneos más largos: divide el archivo o procésalo en lotes a través de la API.
Casos de uso
Escenarios comunes donde esta herramienta te ahorra tiempo.
Contratos y facturas archivadas
Haz años de documentos escaneados buscables — extrae el texto una vez e indéxalo.
Documentos escaneados por teléfono
Las apps de escaneo guardan PDFs de solo imagen. Pásalos por OCR para copiar una dirección, una cláusula o un total.
Libros y reportes antiguos
Convierte páginas escaneadas en texto para citar, traducir o herramientas de accesibilidad.
Alimentar escaneos a IA
Claude y ChatGPT no pueden leer una foto de una página confiablemente. OCR primero, luego pega o canaliza el texto.
Automatiza con la API
Usa la misma herramienta de forma programática. Funciona con cualquier lenguaje — solo HTTP.
# Scanned pages are detected and OCR'd automatically curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...) curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Response metadata tells you which pages were recognized: # "metadata": { "ocr_pages": [1, 2, 3], ... }
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("scan.pdf", "rb")},
params={"output_format": "markdown"},
timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", [])) const formData = new FormData();
formData.append("file", pdfFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
{ method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []); ¿Quieres automatizar esto?
ParseJet API te ofrece el mismo poder de análisis a través de un único endpoint HTTP. Sin ffmpeg, sin poppler, sin tesseract — solo una llamada a la API.
Preguntas frecuentes
¿Cómo hago OCR a un PDF?
Sube el PDF arriba. ParseJet verifica cada página, reconoce las que son solo imágenes y te muestra el texto completo — usualmente dentro de unos pocos segundos para una carta o formulario típico. Cópialo o llama a la API para hacer lo mismo con muchos archivos.
¿Cómo sé si mi PDF necesita OCR?
Ábrelo e intenta seleccionar una palabra. Si nada se resalta, o hacer zoom hace que las letras se vean pixeladas como una foto, la página es una imagen y necesita OCR. Los PDFs de escáneres, máquinas de fax y apps de escaneo de teléfono casi siempre son así.
¿Obtengo un PDF buscable de vuelta?
Obtienes el texto, no un nuevo archivo PDF. Eso es lo que necesitas para copiar, buscar, indexar, traducir o alimentar un modelo de IA. Si específicamente necesitas el PDF original con una capa de texto invisible agregada, una herramienta de escritorio como OCRmyPDF hace eso.
¿Hay un límite de páginas?
Hasta 30 páginas escaneadas se reconocen por solicitud; las páginas que ya contienen texto no cuentan. Para escaneos más largos, divide el archivo o envíalo en partes vía API. Los metadatos de respuesta listan las páginas que se reconocieron y cualquiera que se saltó.
¿Qué idiomas se soportan?
Inglés y todos los idiomas de alfabeto latino, chino simplificado y tradicional, y japonés funcionan automáticamente. Para coreano, ruso y otros idiomas cirílicos, árabe, hindi, tailandés o griego, pasa language=ko, ru, ar, hi, th o el (las versiones localizadas de esta página lo hacen por ti).
¿Es gratis?
Sí. Tres conversiones gratuitas al día sin registro, 300 créditos al mes con una cuenta gratuita y planes de pago desde $19/mes para archivos más grandes y cuotas más altas.
Herramientas relacionadas
Image to Text — Free OCR (Optical Character Recognition)
Convert image to text online for free. OCR reads JPG, PNG, WebP and photos in 20+ languages and returns copy-ready text — no signup. API for developers too.
PDF to Text Converter
Convert PDF to text online for free. This PDF text converter handles multi-page files, scanned PDFs (OCR), and complex layouts. No signup — or automate via API.
Extract Text from PDF
Extract text from any PDF in seconds — digital or scanned. Drop the file, copy the text. Free, no signup, nothing to install; developers get the same via API.
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.
Comienza a extraer texto gratis
No requiere registro. Analiza tu primer archivo en segundos.