PDF OCR — Texterkennung für gescannte PDFs
Eine gescannte PDF ist nur Bilder von Seiten: Sie können sie nicht durchsuchen, Text auswählen oder kopieren. ParseJets PDF-OCR zeigt jede reine Bildseite, führt Texterkennung auf eigenen Servern durch und gibt das Dokument als durchsuchbaren, kopierbaren Text zurück. Seiten, die bereits eine Textebene haben, werden unverändert extrahiert, also kommen gemischte Dokumente komplett heraus.
Datei hier ablegen oder durchsuchen
Akzeptiert PDF Dateien
Kostenlos — 3 Anfragen/Tag, keine Anmeldung. für 300 Credits/Monat kostenlos.
So funktioniert es
Gescannte PDF hochladen
Laden Sie die Datei oben hoch – von einem Scanner, einer Handy-Scan-App oder einem Fax. Digitale PDFs mit Textebene funktionieren auch.
Texterkennung, Seite für Seite
ParseJet überprüft jede Seite. Seiten mit echtem Text werden direkt gelesen; reine Bildseiten werden gerendert und durch OCR verarbeitet.
Text kopieren
Kopieren Sie das ganze Dokument oder rufen Sie es als Markdown oder Klartext über die API ab, um es in Suche, Tabellen oder LLM zu einspeisen.
Hauptfunktionen
Was dieses pdf ocr auszeichnet.
Erkennt, welche Seiten OCR brauchen
Nichts zu konfigurieren. Eine Seite mit weniger als ein paar Dutzend extrahierbarer Zeichen wird als Scan behandelt und erkannt; jede andere Seite behält ihren Originaltext.
20+ Sprachen
Sprachen mit lateinischer Schrift, vereinfachtes und traditionelles Chinesisch, und Japanisch brauchen keine Einstellungen. Koreanisch, Kyrillisch, Arabisch, Hindi, Thai und Griechisch funktionieren mit einem Sprach-Hinweis.
Gemischte Dokumente verarbeitet
Verträge mit gescannter Unterschriftenseite, Berichte mit eingefügten Scans – der Text kommt in Seitenreihenfolge mit erkannten Seiten zurück.
Nichts verlässt unsere Server
Seiten werden auf ParseJets eigener Infrastruktur gerendert und erkannt mit Open-Source-Modellen; kein externer KI-Dienst sieht Ihr Dokument.
Markdown oder Klartext
Fordern Sie output_format=markdown an, um Überschriften und Tabellen von digitalen Seiten zu bewahren, oder raw für reinen Text.
Bis zu 30 gescannte Seiten pro Anfrage
Genug für die meisten Briefe, Formulare und Berichte. Längere Scans: teilen Sie die Datei auf, oder verarbeiten Sie sie in Serien über die API.
Anwendungsfälle
Häufige Szenarien, in denen dieses Tool Zeit spart.
Archivierte Verträge und Rechnungen
Machen Sie Jahre von gescannten Papierstapeln durchsuchbar – extrahieren Sie den Text einmal und indexieren Sie ihn.
Mit Handy gescannte Dokumente
Scan-Apps speichern reine Bild-PDFs. Führen Sie sie durch OCR, um eine Adresse, eine Klausel oder einen Betrag zu kopieren.
Alte Bücher und Berichte
Verwandeln Sie gescannte Seiten in Text für Zitate, Übersetzung oder Barrierefreiheits-Tools.
Scans an KI einspeisen
Claude und ChatGPT können ein Seitenfoto nicht zuverlässig lesen. Führen Sie zuerst OCR durch, dann fügen Sie den Text ein oder pipen Sie ihn.
Mit der API automatisieren
Nutzen Sie dasselbe Tool programmatisch. Funktioniert mit jeder Sprache – einfach HTTP.
# Scanned pages are detected and OCR'd automatically curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...) curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Response metadata tells you which pages were recognized: # "metadata": { "ocr_pages": [1, 2, 3], ... }
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("scan.pdf", "rb")},
params={"output_format": "markdown"},
timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", [])) const formData = new FormData();
formData.append("file", pdfFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
{ method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []); Möchten Sie dies automatisieren?
Die ParseJet API bietet Ihnen die gleiche Parsing-Leistung über einen einzigen HTTP-Endpunkt. Kein ffmpeg, kein poppler, kein tesseract — nur ein API-Aufruf.
Häufig gestellte Fragen
Wie führe ich OCR auf einer PDF durch?
Laden Sie die PDF oben hoch. ParseJet schaut auf jede Seite, erkennt die, die nur Bilder sind, und zeigt Ihnen den ganzen Text – normalerweise in wenigen Sekunden bei einem typischen Brief oder Formular. Kopieren Sie ihn, oder rufen Sie die API auf, um das Gleiche für viele Dateien zu tun.
Woher weiß ich, ob meine PDF OCR braucht?
Öffnen Sie sie und versuchen Sie, ein Wort auszuwählen. Wenn nichts hervorgehoben wird, oder wenn das Vergrößern Buchstaben wie ein Foto verpixelt macht, ist die Seite ein Bild und braucht OCR. PDFs von Scannern, Faxgeräten und Handy-Scan-Apps sind fast immer so.
Bekomme ich eine durchsuchbare PDF zurück?
Sie erhalten den Text, keine neue PDF-Datei. Das ist, was Sie brauchen zum Kopieren, Durchsuchen, Indexieren, Übersetzen oder Einspeisen in ein KI-Modell. Wenn Sie speziell eine Original-PDF mit unsichtbarer Textebene brauchen, macht ein Desktop-Tool wie OCRmyPDF das.
Gibt es ein Seitenlimit?
Bis zu 30 gescannte Seiten werden pro Anfrage erkannt; Seiten, die bereits Text enthalten, zählen nicht. Für längere Scans: teilen Sie die Datei auf oder senden Sie sie in Teilen über die API. Die Response-Metadaten listen die erkannten Seiten und übersprungenen auf.
Welche Sprachen werden unterstützt?
Englisch und alle Sprachen mit lateinischer Schrift, vereinfachtes und traditionelles Chinesisch, und Japanisch funktionieren automatisch. Für Koreanisch, Russisch und andere kyrillische Sprachen, Arabisch, Hindi, Thai oder Griechisch, übergeben Sie language=ko, ru, ar, hi, th oder el (lokalisierte Versionen dieser Seite tun das für Sie).
Ist es kostenlos?
Ja. Drei kostenlose Konvertierungen pro Tag ohne Anmeldung, 300 Credits pro Monat mit kostenlosem Konto, und bezahlte Pläne ab 19 $/Monat für größere Dateien und höhere Kontingente.
Verwandte Tools
Image to Text — Free OCR (Optical Character Recognition)
Convert image to text online for free. OCR reads JPG, PNG, WebP and photos in 20+ languages and returns copy-ready text — no signup. API for developers too.
PDF to Text Converter
Convert PDF to text online for free. This PDF text converter handles multi-page files, scanned PDFs (OCR), and complex layouts. No signup — or automate via API.
Extract Text from PDF
Extract text from any PDF in seconds — digital or scanned. Drop the file, copy the text. Free, no signup, nothing to install; developers get the same via API.
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.
Kostenlos mit Textextraktion starten
Keine Anmeldung erforderlich. Parsen Sie Ihre erste Datei in Sekunden.