ParseJet

PDF OCR — Texterkennung für gescannte PDFs

Eine gescannte PDF ist nur Bilder von Seiten: Sie können sie nicht durchsuchen, Text auswählen oder kopieren. ParseJets PDF-OCR zeigt jede reine Bildseite, führt Texterkennung auf eigenen Servern durch und gibt das Dokument als durchsuchbaren, kopierbaren Text zurück. Seiten, die bereits eine Textebene haben, werden unverändert extrahiert, also kommen gemischte Dokumente komplett heraus.

Datei hier ablegen oder durchsuchen

Akzeptiert PDF Dateien

Kostenlos — 3 Anfragen/Tag, keine Anmeldung. für 300 Credits/Monat kostenlos.

So funktioniert es

1

Gescannte PDF hochladen

Laden Sie die Datei oben hoch – von einem Scanner, einer Handy-Scan-App oder einem Fax. Digitale PDFs mit Textebene funktionieren auch.

2

Texterkennung, Seite für Seite

ParseJet überprüft jede Seite. Seiten mit echtem Text werden direkt gelesen; reine Bildseiten werden gerendert und durch OCR verarbeitet.

3

Text kopieren

Kopieren Sie das ganze Dokument oder rufen Sie es als Markdown oder Klartext über die API ab, um es in Suche, Tabellen oder LLM zu einspeisen.

Hauptfunktionen

Was dieses pdf ocr auszeichnet.

Erkennt, welche Seiten OCR brauchen

Nichts zu konfigurieren. Eine Seite mit weniger als ein paar Dutzend extrahierbarer Zeichen wird als Scan behandelt und erkannt; jede andere Seite behält ihren Originaltext.

20+ Sprachen

Sprachen mit lateinischer Schrift, vereinfachtes und traditionelles Chinesisch, und Japanisch brauchen keine Einstellungen. Koreanisch, Kyrillisch, Arabisch, Hindi, Thai und Griechisch funktionieren mit einem Sprach-Hinweis.

Gemischte Dokumente verarbeitet

Verträge mit gescannter Unterschriftenseite, Berichte mit eingefügten Scans – der Text kommt in Seitenreihenfolge mit erkannten Seiten zurück.

Nichts verlässt unsere Server

Seiten werden auf ParseJets eigener Infrastruktur gerendert und erkannt mit Open-Source-Modellen; kein externer KI-Dienst sieht Ihr Dokument.

Markdown oder Klartext

Fordern Sie output_format=markdown an, um Überschriften und Tabellen von digitalen Seiten zu bewahren, oder raw für reinen Text.

Bis zu 30 gescannte Seiten pro Anfrage

Genug für die meisten Briefe, Formulare und Berichte. Längere Scans: teilen Sie die Datei auf, oder verarbeiten Sie sie in Serien über die API.

Anwendungsfälle

Häufige Szenarien, in denen dieses Tool Zeit spart.

Archivierte Verträge und Rechnungen

Machen Sie Jahre von gescannten Papierstapeln durchsuchbar – extrahieren Sie den Text einmal und indexieren Sie ihn.

Mit Handy gescannte Dokumente

Scan-Apps speichern reine Bild-PDFs. Führen Sie sie durch OCR, um eine Adresse, eine Klausel oder einen Betrag zu kopieren.

Alte Bücher und Berichte

Verwandeln Sie gescannte Seiten in Text für Zitate, Übersetzung oder Barrierefreiheits-Tools.

Scans an KI einspeisen

Claude und ChatGPT können ein Seitenfoto nicht zuverlässig lesen. Führen Sie zuerst OCR durch, dann fügen Sie den Text ein oder pipen Sie ihn.

Mit der API automatisieren

Nutzen Sie dasselbe Tool programmatisch. Funktioniert mit jeder Sprache – einfach HTTP.

cURL
# Scanned pages are detected and OCR'd automatically
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...)
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Response metadata tells you which pages were recognized:
# "metadata": { "ocr_pages": [1, 2, 3], ... }
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("scan.pdf", "rb")},
    params={"output_format": "markdown"},
    timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", []))
JavaScript
const formData = new FormData();
formData.append("file", pdfFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
  { method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []);

Möchten Sie dies automatisieren?

Die ParseJet API bietet Ihnen die gleiche Parsing-Leistung über einen einzigen HTTP-Endpunkt. Kein ffmpeg, kein poppler, kein tesseract — nur ein API-Aufruf.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
API-Dokumentation lesen

Häufig gestellte Fragen

Wie führe ich OCR auf einer PDF durch?

Laden Sie die PDF oben hoch. ParseJet schaut auf jede Seite, erkennt die, die nur Bilder sind, und zeigt Ihnen den ganzen Text – normalerweise in wenigen Sekunden bei einem typischen Brief oder Formular. Kopieren Sie ihn, oder rufen Sie die API auf, um das Gleiche für viele Dateien zu tun.

Woher weiß ich, ob meine PDF OCR braucht?

Öffnen Sie sie und versuchen Sie, ein Wort auszuwählen. Wenn nichts hervorgehoben wird, oder wenn das Vergrößern Buchstaben wie ein Foto verpixelt macht, ist die Seite ein Bild und braucht OCR. PDFs von Scannern, Faxgeräten und Handy-Scan-Apps sind fast immer so.

Bekomme ich eine durchsuchbare PDF zurück?

Sie erhalten den Text, keine neue PDF-Datei. Das ist, was Sie brauchen zum Kopieren, Durchsuchen, Indexieren, Übersetzen oder Einspeisen in ein KI-Modell. Wenn Sie speziell eine Original-PDF mit unsichtbarer Textebene brauchen, macht ein Desktop-Tool wie OCRmyPDF das.

Gibt es ein Seitenlimit?

Bis zu 30 gescannte Seiten werden pro Anfrage erkannt; Seiten, die bereits Text enthalten, zählen nicht. Für längere Scans: teilen Sie die Datei auf oder senden Sie sie in Teilen über die API. Die Response-Metadaten listen die erkannten Seiten und übersprungenen auf.

Welche Sprachen werden unterstützt?

Englisch und alle Sprachen mit lateinischer Schrift, vereinfachtes und traditionelles Chinesisch, und Japanisch funktionieren automatisch. Für Koreanisch, Russisch und andere kyrillische Sprachen, Arabisch, Hindi, Thai oder Griechisch, übergeben Sie language=ko, ru, ar, hi, th oder el (lokalisierte Versionen dieser Seite tun das für Sie).

Ist es kostenlos?

Ja. Drei kostenlose Konvertierungen pro Tag ohne Anmeldung, 300 Credits pro Monat mit kostenlosem Konto, und bezahlte Pläne ab 19 $/Monat für größere Dateien und höhere Kontingente.

Kostenlos mit Textextraktion starten

Keine Anmeldung erforderlich. Parsen Sie Ihre erste Datei in Sekunden.

Preise ansehen