ParseJet

PDF OCR — Reconnaissance de texte pour PDFs scannés

Un PDF scanné n'est que des images de pages : vous ne pouvez pas le rechercher, sélectionner du texte ou en copier. Le PDF OCR de ParseJet affiche chaque page uniquement image, exécute une reconnaissance de texte sur nos propres serveurs et renvoie le document en texte que vous pouvez rechercher, copier et réutiliser. Les pages qui ont déjà un calque de texte sont extraites telles quelles, donc les documents mixtes sortent complets.

Déposez un fichier ici ou parcourir

Accepte les fichiers PDF

Gratuit — 3 requêtes/jour, pas d'inscription. pour 300 crédits/mois gratuits.

Comment ça marche

1

Téléversez le PDF scanné

Déposez le fichier ci-dessus — d'un scanner, d'une application de numérisation mobile ou d'un fax. Les PDFs numériques avec un calque de texte fonctionnent aussi.

2

Reconnaissance de texte, page par page

ParseJet vérifie chaque page. Les pages avec du texte réel sont lues directement ; les pages uniquement image sont affichées et traitées par l'OCR.

3

Copiez le texte

Copiez l'ensemble du document ou récupérez-le en tant que Markdown ou texte brut via l'API pour alimenter la recherche, les feuilles de calcul ou un LLM.

Fonctionnalités clés

Ce qui distingue ce pdf ocr.

Détecte quelles pages ont besoin d'OCR

Rien à configurer. Une page avec moins de quelques douzaines de caractères extractibles est traitée comme un scan et reconnue ; chaque autre page conserve son texte original.

20+ langues

Les langues à caractères latins, le chinois simplifié et traditionnel et le japonais ne nécessitent aucun paramètre. Les scans coréen, cyrillique, arabe, hindi, thaï et grec fonctionnent avec un indice de langue.

Documents mixtes gérés

Les contrats avec une page de signature scannée, les rapports avec des scans insérés — le texte revient dans l'ordre des pages avec les pages reconnues épissées.

Rien ne quitte nos serveurs

Les pages sont affichées et reconnues sur l'infrastructure propre de ParseJet avec des modèles open-source ; aucun service IA tiers ne voit votre document.

Markdown ou texte brut

Demandez output_format=markdown pour conserver les titres et tableaux des pages numériques, ou raw pour du texte brut.

Jusqu'à 30 pages scannées par demande

Suffisant pour la plupart des lettres, formulaires et rapports. Scans plus longs : divisez le fichier ou traitez-le par lots via l'API.

Cas d'utilisation

Scénarios courants où cet outil vous fait gagner du temps.

Contrats et factures archivés

Rendez des années de documents numérisés consultables — extrayez le texte une fois et indexez-le.

Documents numérisés par téléphone

Les applications de numérisation enregistrent les PDFs uniquement image. Exécutez-les via l'OCR pour copier une adresse, une clause ou un total.

Vieux livres et rapports

Transformez les pages scannées en texte pour la citation, la traduction ou les outils d'accessibilité.

Alimenter les scans à l'IA

Claude et ChatGPT ne peuvent pas lire une photo de page de manière fiable. Exécutez l'OCR d'abord, puis collez ou pipe le texte.

Automatiser avec l'API

Utilisez le même outil de manière programmatique. Fonctionne avec n'importe quel langage — juste du HTTP.

cURL
# Scanned pages are detected and OCR'd automatically
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...)
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Response metadata tells you which pages were recognized:
# "metadata": { "ocr_pages": [1, 2, 3], ... }
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("scan.pdf", "rb")},
    params={"output_format": "markdown"},
    timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", []))
JavaScript
const formData = new FormData();
formData.append("file", pdfFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
  { method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []);

Vous voulez automatiser cela ?

L'API ParseJet vous offre la même puissance d'analyse via un seul point de terminaison HTTP. Pas de ffmpeg, poppler ou tesseract — juste un appel API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Lire la documentation API

Questions fréquentes

Comment faire l'OCR d'un PDF ?

Téléversez le PDF ci-dessus. ParseJet regarde chaque page, reconnaît celles qui ne sont que des images et vous montre le texte complet — généralement en quelques secondes pour une lettre ou un formulaire typique. Copiez-le ou appelez l'API pour faire la même chose avec de nombreux fichiers.

Comment savoir si mon PDF a besoin d'OCR ?

Ouvrez-le et essayez de sélectionner un mot. Si rien ne met en surbrillance, ou si le zoom révèle des lettres pixélisées comme une photo, la page est une image et a besoin d'OCR. Les PDFs de scanners, de télécopieurs et d'applications de numérisation mobile sont presque toujours comme cela.

Récupéré-je un PDF consultable ?

Vous obtenez le texte, pas un nouveau fichier PDF. C'est ce que vous devez copier, rechercher, indexer, traduire ou alimenter un modèle IA. Si vous avez vraiment besoin du PDF d'origine avec un calque de texte invisible ajouté, un outil de bureau comme OCRmyPDF le fait.

Y a-t-il une limite de pages ?

Jusqu'à 30 pages scannées sont reconnues par demande ; les pages qui contiennent déjà du texte ne comptent pas. Pour les scans plus longs, divisez le fichier ou envoyez-le par parties via l'API. Les métadonnées de réponse listent les pages qui ont été reconnues et celles qui ont été ignorées.

Quelles langues sont prises en charge ?

L'anglais et toutes les langues à caractères latins, le chinois simplifié et traditionnel et le japonais fonctionnent automatiquement. Pour le coréen, le russe et autres langues cyrilliques, l'arabe, l'hindi, le thaï ou le grec, passez language=ko, ru, ar, hi, th ou el (les versions localisées de cette page le font pour vous).

Est-ce gratuit ?

Oui. Trois conversions gratuites par jour sans inscription, 300 crédits par mois avec un compte gratuit, et des plans payants à partir de 19 $/mois pour des fichiers plus volumineux et des quotas plus élevés.

Commencez à extraire du texte gratuitement

Aucune inscription requise. Analysez votre premier fichier en quelques secondes.

Voir les tarifs