ParseJet

PDF OCR — reconhecimento de texto para PDFs digitalizados

Um PDF digitalizado é apenas imagens de páginas: você não consegue pesquisar, selecionar texto ou copiar. O PDF OCR do ParseJet renderiza cada página apenas com imagem, executa reconhecimento de texto em seus próprios servidores e retorna o documento como texto que você pode pesquisar, copiar e reutilizar. Páginas que já têm uma camada de texto são extraídas como estão, então documentos mistos saem completos.

Solte um arquivo aqui ou procure

Aceita arquivos PDF

Grátis — 3 requisições/dia, sem cadastro. para 300 créditos/mês grátis.

Como funciona

1

Envie o PDF digitalizado

Solte o arquivo acima — de um scanner, app de digitalização de celular ou fax. PDFs digitais com uma camada de texto funcionam também.

2

Reconhecimento de texto, página por página

ParseJet verifica cada página. Páginas com texto real são lidas diretamente; páginas apenas com imagem são renderizadas e passam por OCR.

3

Copie o texto

Copie o documento inteiro ou busque-o como Markdown ou texto simples pela API para alimentar busca, planilhas ou um LLM.

Principais recursos

O que faz este pdf ocr se destacar.

Detecta quais páginas precisam de OCR

Nenhuma configuração. Uma página com menos de algumas dúzias de caracteres extraíveis é tratada como uma digitalização e reconhecida; toda outra página mantém seu texto original.

20+ idiomas

Idiomas latino-script, chinês simplificado e tradicional, e japonês não precisam de configuração. Coreano, cirílico, árabe, hindi, tailandês e grego funcionam com uma dica de idioma.

Documentos mistos lida

Contratos com página de assinatura digitalizada, relatórios com digitalizações inseridas — o texto volta na ordem das páginas com as páginas reconhecidas embutidas.

Nada sai dos nossos servidores

Páginas são renderizadas e reconhecidas na infraestrutura própria do ParseJet com modelos de código aberto; nenhum serviço de IA terceirizado vê seu documento.

Markdown ou texto simples

Peça por output_format=markdown para manter títulos e tabelas das páginas digitais, ou raw para texto simples.

Até 30 páginas digitalizadas por requisição

Suficiente para a maioria de cartas, formulários e relatórios. Digitalizações mais longas: divida o arquivo ou processe em lotes pela API.

Casos de uso

Cenários comuns onde esta ferramenta economiza seu tempo.

Contratos e faturas arquivados

Torne anos de papéis digitalizados pesquisáveis — extraia o texto uma vez e indexe-o.

Documentos digitalizados com celular

Apps de scanner salvam PDFs apenas com imagem. Execute-os por OCR para copiar um endereço, cláusula ou total.

Livros e relatórios antigos

Transforme páginas digitalizadas em texto para citação, tradução ou ferramentas de acessibilidade.

Alimentar digitalizações para IA

Claude e ChatGPT não conseguem ler uma foto de página de forma confiável. Execute OCR primeiro, depois cole ou encaminhe o texto.

Automatize com a API

Use a mesma ferramenta de forma programática. Funciona com qualquer linguagem — apenas HTTP.

cURL
# Scanned pages are detected and OCR'd automatically
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...)
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Response metadata tells you which pages were recognized:
# "metadata": { "ocr_pages": [1, 2, 3], ... }
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("scan.pdf", "rb")},
    params={"output_format": "markdown"},
    timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", []))
JavaScript
const formData = new FormData();
formData.append("file", pdfFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
  { method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []);

Quer automatizar isso?

A ParseJet API oferece o mesmo poder de análise através de um único endpoint HTTP. Sem ffmpeg, sem poppler, sem tesseract — apenas uma chamada de API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Ler Documentação da API

Perguntas frequentes

Como executo OCR de um PDF?

Envie o PDF acima. ParseJet olha cada página, reconhece as que são apenas imagens e mostra o texto completo — geralmente em alguns segundos para uma carta ou formulário típico. Copie ou chame a API para fazer o mesmo para muitos arquivos.

Como sei se meu PDF precisa de OCR?

Abra-o e tente selecionar uma palavra. Se nada destaca, ou der zoom fica pixelado como uma foto, a página é uma imagem e precisa de OCR. PDFs de scanners, máquinas de fax e apps de scanner de celular são quase sempre assim.

Recebo um PDF pesquisável de volta?

Você recebe o texto, não um novo arquivo PDF. É isso que você precisa para copiar, pesquisar, indexar, traduzir ou alimentar um modelo de IA. Se especificamente precisa do PDF original com uma camada de texto invisível adicionada, uma ferramenta de desktop como OCRmyPDF faz isso.

Existe um limite de páginas?

Até 30 páginas digitalizadas são reconhecidas por requisição; páginas que já contêm texto não contam. Para digitalizações mais longas, divida o arquivo ou envie em partes pela API. Os metadados de resposta listam as páginas reconhecidas e qualquer uma que foi pulada.

Quais idiomas são suportados?

Inglês e todos os idiomas latino-script, chinês simplificado e tradicional, e japonês funcionam automaticamente. Para coreano, russo e outras línguas cirílicas, árabe, hindi, tailandês ou grego, passe language=ko, ru, ar, hi, th ou el (as versões localizadas desta página fazem por você).

É grátis?

Sim. Três conversões gratuitas por dia sem cadastro, 300 créditos por mês com uma conta gratuita e planos pagos a partir de US$ 19/mês para arquivos maiores e cotas mais altas.

Comece a extrair texto gratuitamente

Sem necessidade de cadastro. Analise seu primeiro arquivo em segundos.

Ver Preços