PDF OCR — Reconnaissance de texte pour PDFs scannés
Un PDF scanné n'est que des images de pages : vous ne pouvez pas le rechercher, sélectionner du texte ou en copier. Le PDF OCR de ParseJet affiche chaque page uniquement image, exécute une reconnaissance de texte sur nos propres serveurs et renvoie le document en texte que vous pouvez rechercher, copier et réutiliser. Les pages qui ont déjà un calque de texte sont extraites telles quelles, donc les documents mixtes sortent complets.
Déposez un fichier ici ou parcourir
Accepte les fichiers PDF
Gratuit — 3 requêtes/jour, pas d'inscription. pour 300 crédits/mois gratuits.
Comment ça marche
Téléversez le PDF scanné
Déposez le fichier ci-dessus — d'un scanner, d'une application de numérisation mobile ou d'un fax. Les PDFs numériques avec un calque de texte fonctionnent aussi.
Reconnaissance de texte, page par page
ParseJet vérifie chaque page. Les pages avec du texte réel sont lues directement ; les pages uniquement image sont affichées et traitées par l'OCR.
Copiez le texte
Copiez l'ensemble du document ou récupérez-le en tant que Markdown ou texte brut via l'API pour alimenter la recherche, les feuilles de calcul ou un LLM.
Fonctionnalités clés
Ce qui distingue ce pdf ocr.
Détecte quelles pages ont besoin d'OCR
Rien à configurer. Une page avec moins de quelques douzaines de caractères extractibles est traitée comme un scan et reconnue ; chaque autre page conserve son texte original.
20+ langues
Les langues à caractères latins, le chinois simplifié et traditionnel et le japonais ne nécessitent aucun paramètre. Les scans coréen, cyrillique, arabe, hindi, thaï et grec fonctionnent avec un indice de langue.
Documents mixtes gérés
Les contrats avec une page de signature scannée, les rapports avec des scans insérés — le texte revient dans l'ordre des pages avec les pages reconnues épissées.
Rien ne quitte nos serveurs
Les pages sont affichées et reconnues sur l'infrastructure propre de ParseJet avec des modèles open-source ; aucun service IA tiers ne voit votre document.
Markdown ou texte brut
Demandez output_format=markdown pour conserver les titres et tableaux des pages numériques, ou raw pour du texte brut.
Jusqu'à 30 pages scannées par demande
Suffisant pour la plupart des lettres, formulaires et rapports. Scans plus longs : divisez le fichier ou traitez-le par lots via l'API.
Cas d'utilisation
Scénarios courants où cet outil vous fait gagner du temps.
Contrats et factures archivés
Rendez des années de documents numérisés consultables — extrayez le texte une fois et indexez-le.
Documents numérisés par téléphone
Les applications de numérisation enregistrent les PDFs uniquement image. Exécutez-les via l'OCR pour copier une adresse, une clause ou un total.
Vieux livres et rapports
Transformez les pages scannées en texte pour la citation, la traduction ou les outils d'accessibilité.
Alimenter les scans à l'IA
Claude et ChatGPT ne peuvent pas lire une photo de page de manière fiable. Exécutez l'OCR d'abord, puis collez ou pipe le texte.
Automatiser avec l'API
Utilisez le même outil de manière programmatique. Fonctionne avec n'importe quel langage — juste du HTTP.
# Scanned pages are detected and OCR'd automatically curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...) curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Response metadata tells you which pages were recognized: # "metadata": { "ocr_pages": [1, 2, 3], ... }
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("scan.pdf", "rb")},
params={"output_format": "markdown"},
timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", [])) const formData = new FormData();
formData.append("file", pdfFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
{ method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []); Vous voulez automatiser cela ?
L'API ParseJet vous offre la même puissance d'analyse via un seul point de terminaison HTTP. Pas de ffmpeg, poppler ou tesseract — juste un appel API.
Questions fréquentes
Comment faire l'OCR d'un PDF ?
Téléversez le PDF ci-dessus. ParseJet regarde chaque page, reconnaît celles qui ne sont que des images et vous montre le texte complet — généralement en quelques secondes pour une lettre ou un formulaire typique. Copiez-le ou appelez l'API pour faire la même chose avec de nombreux fichiers.
Comment savoir si mon PDF a besoin d'OCR ?
Ouvrez-le et essayez de sélectionner un mot. Si rien ne met en surbrillance, ou si le zoom révèle des lettres pixélisées comme une photo, la page est une image et a besoin d'OCR. Les PDFs de scanners, de télécopieurs et d'applications de numérisation mobile sont presque toujours comme cela.
Récupéré-je un PDF consultable ?
Vous obtenez le texte, pas un nouveau fichier PDF. C'est ce que vous devez copier, rechercher, indexer, traduire ou alimenter un modèle IA. Si vous avez vraiment besoin du PDF d'origine avec un calque de texte invisible ajouté, un outil de bureau comme OCRmyPDF le fait.
Y a-t-il une limite de pages ?
Jusqu'à 30 pages scannées sont reconnues par demande ; les pages qui contiennent déjà du texte ne comptent pas. Pour les scans plus longs, divisez le fichier ou envoyez-le par parties via l'API. Les métadonnées de réponse listent les pages qui ont été reconnues et celles qui ont été ignorées.
Quelles langues sont prises en charge ?
L'anglais et toutes les langues à caractères latins, le chinois simplifié et traditionnel et le japonais fonctionnent automatiquement. Pour le coréen, le russe et autres langues cyrilliques, l'arabe, l'hindi, le thaï ou le grec, passez language=ko, ru, ar, hi, th ou el (les versions localisées de cette page le font pour vous).
Est-ce gratuit ?
Oui. Trois conversions gratuites par jour sans inscription, 300 crédits par mois avec un compte gratuit, et des plans payants à partir de 19 $/mois pour des fichiers plus volumineux et des quotas plus élevés.
Outils associés
Image to Text — Free OCR (Optical Character Recognition)
Convert image to text online for free. OCR reads JPG, PNG, WebP and photos in 20+ languages and returns copy-ready text — no signup. API for developers too.
PDF to Text Converter
Convert PDF to text online for free. This PDF text converter handles multi-page files, scanned PDFs (OCR), and complex layouts. No signup — or automate via API.
Extract Text from PDF
Extract text from any PDF in seconds — digital or scanned. Drop the file, copy the text. Free, no signup, nothing to install; developers get the same via API.
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.
Commencez à extraire du texte gratuitement
Aucune inscription requise. Analysez votre premier fichier en quelques secondes.