PDF OCR — reconhecimento de texto para PDFs digitalizados
Um PDF digitalizado é apenas imagens de páginas: você não consegue pesquisar, selecionar texto ou copiar. O PDF OCR do ParseJet renderiza cada página apenas com imagem, executa reconhecimento de texto em seus próprios servidores e retorna o documento como texto que você pode pesquisar, copiar e reutilizar. Páginas que já têm uma camada de texto são extraídas como estão, então documentos mistos saem completos.
Solte um arquivo aqui ou procure
Aceita arquivos PDF
Grátis — 3 requisições/dia, sem cadastro. para 300 créditos/mês grátis.
Como funciona
Envie o PDF digitalizado
Solte o arquivo acima — de um scanner, app de digitalização de celular ou fax. PDFs digitais com uma camada de texto funcionam também.
Reconhecimento de texto, página por página
ParseJet verifica cada página. Páginas com texto real são lidas diretamente; páginas apenas com imagem são renderizadas e passam por OCR.
Copie o texto
Copie o documento inteiro ou busque-o como Markdown ou texto simples pela API para alimentar busca, planilhas ou um LLM.
Principais recursos
O que faz este pdf ocr se destacar.
Detecta quais páginas precisam de OCR
Nenhuma configuração. Uma página com menos de algumas dúzias de caracteres extraíveis é tratada como uma digitalização e reconhecida; toda outra página mantém seu texto original.
20+ idiomas
Idiomas latino-script, chinês simplificado e tradicional, e japonês não precisam de configuração. Coreano, cirílico, árabe, hindi, tailandês e grego funcionam com uma dica de idioma.
Documentos mistos lida
Contratos com página de assinatura digitalizada, relatórios com digitalizações inseridas — o texto volta na ordem das páginas com as páginas reconhecidas embutidas.
Nada sai dos nossos servidores
Páginas são renderizadas e reconhecidas na infraestrutura própria do ParseJet com modelos de código aberto; nenhum serviço de IA terceirizado vê seu documento.
Markdown ou texto simples
Peça por output_format=markdown para manter títulos e tabelas das páginas digitais, ou raw para texto simples.
Até 30 páginas digitalizadas por requisição
Suficiente para a maioria de cartas, formulários e relatórios. Digitalizações mais longas: divida o arquivo ou processe em lotes pela API.
Casos de uso
Cenários comuns onde esta ferramenta economiza seu tempo.
Contratos e faturas arquivados
Torne anos de papéis digitalizados pesquisáveis — extraia o texto uma vez e indexe-o.
Documentos digitalizados com celular
Apps de scanner salvam PDFs apenas com imagem. Execute-os por OCR para copiar um endereço, cláusula ou total.
Livros e relatórios antigos
Transforme páginas digitalizadas em texto para citação, tradução ou ferramentas de acessibilidade.
Alimentar digitalizações para IA
Claude e ChatGPT não conseguem ler uma foto de página de forma confiável. Execute OCR primeiro, depois cole ou encaminhe o texto.
Automatize com a API
Use a mesma ferramenta de forma programática. Funciona com qualquer linguagem — apenas HTTP.
# Scanned pages are detected and OCR'd automatically curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...) curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Response metadata tells you which pages were recognized: # "metadata": { "ocr_pages": [1, 2, 3], ... }
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("scan.pdf", "rb")},
params={"output_format": "markdown"},
timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", [])) const formData = new FormData();
formData.append("file", pdfFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
{ method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []); Quer automatizar isso?
A ParseJet API oferece o mesmo poder de análise através de um único endpoint HTTP. Sem ffmpeg, sem poppler, sem tesseract — apenas uma chamada de API.
Perguntas frequentes
Como executo OCR de um PDF?
Envie o PDF acima. ParseJet olha cada página, reconhece as que são apenas imagens e mostra o texto completo — geralmente em alguns segundos para uma carta ou formulário típico. Copie ou chame a API para fazer o mesmo para muitos arquivos.
Como sei se meu PDF precisa de OCR?
Abra-o e tente selecionar uma palavra. Se nada destaca, ou der zoom fica pixelado como uma foto, a página é uma imagem e precisa de OCR. PDFs de scanners, máquinas de fax e apps de scanner de celular são quase sempre assim.
Recebo um PDF pesquisável de volta?
Você recebe o texto, não um novo arquivo PDF. É isso que você precisa para copiar, pesquisar, indexar, traduzir ou alimentar um modelo de IA. Se especificamente precisa do PDF original com uma camada de texto invisível adicionada, uma ferramenta de desktop como OCRmyPDF faz isso.
Existe um limite de páginas?
Até 30 páginas digitalizadas são reconhecidas por requisição; páginas que já contêm texto não contam. Para digitalizações mais longas, divida o arquivo ou envie em partes pela API. Os metadados de resposta listam as páginas reconhecidas e qualquer uma que foi pulada.
Quais idiomas são suportados?
Inglês e todos os idiomas latino-script, chinês simplificado e tradicional, e japonês funcionam automaticamente. Para coreano, russo e outras línguas cirílicas, árabe, hindi, tailandês ou grego, passe language=ko, ru, ar, hi, th ou el (as versões localizadas desta página fazem por você).
É grátis?
Sim. Três conversões gratuitas por dia sem cadastro, 300 créditos por mês com uma conta gratuita e planos pagos a partir de US$ 19/mês para arquivos maiores e cotas mais altas.
Ferramentas relacionadas
Image to Text — Free OCR (Optical Character Recognition)
Convert image to text online for free. OCR reads JPG, PNG, WebP and photos in 20+ languages and returns copy-ready text — no signup. API for developers too.
PDF to Text Converter
Convert PDF to text online for free. This PDF text converter handles multi-page files, scanned PDFs (OCR), and complex layouts. No signup — or automate via API.
Extract Text from PDF
Extract text from any PDF in seconds — digital or scanned. Drop the file, copy the text. Free, no signup, nothing to install; developers get the same via API.
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.
Comece a extrair texto gratuitamente
Sem necessidade de cadastro. Analise seu primeiro arquivo em segundos.