ParseJet

PDF OCR — riconoscimento testo per PDF scansionati

Un PDF scansionato è solo immagini di pagine: non puoi cercarlo, selezionare testo o copiarne. L'OCR PDF di ParseJet renderizza ogni pagina di sola immagine, esegue il riconoscimento del testo sui nostri server e restituisce il documento come testo che puoi cercare, copiare e riutilizzare. Le pagine che già hanno uno strato di testo vengono estratte così come sono, quindi i documenti misti escono completi.

Trascina un file qui o sfoglia

Accetta file PDF

Gratuito — 3 richieste/giorno, nessuna registrazione. per 300 crediti/mese gratuiti.

Come funziona

1

Carica il PDF scansionato

Trascina il file qui sopra — da uno scanner, un'app di scansione da telefono o un fax. I PDF digitali con uno strato di testo funzionano anche.

2

Riconoscimento testo, pagina per pagina

ParseJet controlla ogni pagina. Le pagine con testo vero vengono lette direttamente; le pagine di sola immagine vengono rese e passate attraverso l'OCR.

3

Copia il testo

Copia l'intero documento, o recuperalo come Markdown o testo semplice attraverso l'API per alimentare ricerca, fogli di calcolo o un LLM.

Funzionalità principali

Cosa rende questo pdf ocr unico.

Rileva quali pagine hanno bisogno di OCR

Nulla da configurare. Una pagina con meno di un paio di dozzine di caratteri estraibili viene trattata come una scansione e riconosciuta; ogni altra pagina mantiene il suo testo originale.

20+ lingue

Le lingue con alfabeto latino, cinese semplificato e tradizionale e il giapponese non hanno bisogno di impostazioni. Le scansioni coreane, cirilliche, arabe, hindi, thai e greche funzionano con un suggerimento di lingua.

Documenti misti gestiti

Contratti con una pagina di firma scansionata, report con scansioni inserite — il testo viene restituito nell'ordine delle pagine con le pagine riconosciute inserite.

Nulla lascia i nostri server

Le pagine vengono rese e riconosciute sull'infrastruttura di ParseJet con modelli open-source; nessun servizio AI di terze parti vede il tuo documento.

Markdown o testo semplice

Chiedi output_format=markdown per mantenere intestazioni e tabelle dalle pagine digitali, o raw per testo semplice.

Fino a 30 pagine scansionate per richiesta

Abbastanza per la maggior parte di lettere, moduli e report. Scansioni più lunghe: dividi il file, o elaboralo in lotti attraverso l'API.

Casi d'uso

Scenari comuni in cui questo strumento ti fa risparmiare tempo.

Contratti e fatture archiviati

Rendi ricercabili anni di documenti cartacei scansionati — estrai il testo una volta e indicizzalo.

Documenti scansionati da telefono

Le app di scansione salvano PDF di sola immagine. Esegui OCR per copiare un indirizzo, una clausola o un totale.

Libri e report antichi

Converti pagine scansionate in testo per citazioni, traduzioni o strumenti di accessibilità.

Alimentazione di scansioni all'AI

Claude e ChatGPT non riescono a leggere in modo affidabile un'immagine di una pagina. Esegui OCR prima, poi incolla o piega il testo.

Automatizza con l'API

Usa lo stesso strumento in modo programmatico. Funziona con qualsiasi linguaggio — basta HTTP.

cURL
# Scanned pages are detected and OCR'd automatically
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...)
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Response metadata tells you which pages were recognized:
# "metadata": { "ocr_pages": [1, 2, 3], ... }
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("scan.pdf", "rb")},
    params={"output_format": "markdown"},
    timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", []))
JavaScript
const formData = new FormData();
formData.append("file", pdfFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
  { method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []);

Vuoi automatizzare questo processo?

L'API ParseJet ti offre la stessa potenza di analisi tramite un singolo endpoint HTTP. Niente ffmpeg, poppler o tesseract — basta una sola chiamata API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Leggi la Documentazione API

Domande frequenti

Come faccio OCR di un PDF?

Carica il PDF qui sopra. ParseJet guarda ogni pagina, riconosce quelle che sono solo immagini e ti mostra il testo completo — di solito entro pochi secondi per una lettera o un modulo tipico. Copia, o chiama l'API per fare lo stesso per molti file.

Come faccio a sapere se il mio PDF ha bisogno di OCR?

Aprilo e prova a selezionare una parola. Se nulla si evidenzia, o lo zoom ti fa apparire le lettere pixelate come una foto, la pagina è un'immagine e ha bisogno di OCR. I PDF da scanner, fax e app di scansione da telefono sono quasi sempre così.

Ottengo un PDF ricercabile indietro?

Ottieni il testo, non un nuovo file PDF. Quello è quello che serve per copiare, cercare, indicizzare, tradurre o alimentare un modello AI. Se hai specificamente bisogno del PDF originale con uno strato di testo invisibile aggiunto, uno strumento desktop come OCRmyPDF lo fa.

C'è un limite di pagine?

Fino a 30 pagine scansionate vengono riconosciute per richiesta; le pagine che contengono già testo non contano. Per scansioni più lunghe, dividi il file o invialo in parti tramite l'API. I metadati di risposta elencano le pagine riconosciute e quelle eventualmente saltate.

Quali lingue sono supportate?

L'inglese e tutte le lingue con alfabeto latino, cinese semplificato e tradizionale e il giapponese funzionano automaticamente. Per coreano, russo e altre lingue cirilliche, arabo, hindi, thai o greco, passa language=ko, ru, ar, hi, th o el (le versioni localizzate di questa pagina lo fanno per te).

È gratuito?

Sì. Tre conversioni gratuite al giorno senza registrazione, 300 crediti al mese con un account gratuito, e piani a pagamento da $19/mese per file più grandi e quote più alte.

Inizia a estrarre testo gratuitamente

Nessuna registrazione richiesta. Analizza il tuo primo file in pochi secondi.

Vedi i Prezzi