PDF OCR — Rozpoznawanie tekstu dla zeskanowanych PDF-ów
Zeskanowany PDF to tylko zdjęcia stron: nie możesz go przeszukiwać, zaznaczać tekstu ani kopiować z niego. PDF OCR ParseJet renderuje każdą stronę zawierającą tylko obrazy, uruchamia rozpoznawanie tekstu na własnych serwerach i zwraca dokument jako tekst, który możesz przeszukiwać, kopiować i ponownie wykorzystywać. Strony, które już mają warstwę tekstu, są wyodrębniane bez zmian, więc dokumenty mieszane wychodzą kompletne.
Upuść plik tutaj lub przeglądaj
Akceptuje pliki PDF
Darmowe — 3 żądania/dzień, bez rejestracji. za 300 kredytów/miesiąc za darmo.
Jak to działa
Prześlij zeskanowany PDF
Upuść plik powyżej — ze skanera, aplikacji do skanowania smartfona lub faksu. Cyfrowe PDF-y z warstwą tekstu również działają.
Rozpoznawanie tekstu, strona po stronie
ParseJet sprawdza każdą stronę. Strony z rzeczywistym tekstem są odczytywane bezpośrednio; strony zawierające tylko obrazy są renderowane i przesyłane przez OCR.
Skopiuj tekst
Skopiuj cały dokument, lub pobierz go w formacie Markdown lub zwykłego tekstu przez API, aby zasilić wyszukiwarki, arkusze kalkulacyjne lub LLM.
Kluczowe funkcje
Co wyróżnia to pdf ocr.
Wykrywa, które strony potrzebują OCR
Nic do konfiguracji. Strona z mniej niż kilkadziesiątkoma znakami do wyodrębnienia jest traktowana jako skan i rozpoznawana; każda inna strona zachowuje oryginalny tekst.
20+ języków
Języki ze znakami łacińskimi, chiński uproszczony i tradycyjny oraz japoński nie wymagają ustawień. Skany w języku koreańskim, cyrylicy, arabskim, hindi, tajskim i greckim działają ze wskazówką dotyczącą języka.
Obsługa dokumentów mieszanych
Umowy ze zeskanowaną stroną podpisu, raporty ze wstawionymi skanami — tekst wraca w kolejności stron ze zeskanowanymi stronami splecione.
Nic nie opuszcza naszych serwerów
Strony są renderowane i rozpoznawane na infrastrukturze ParseJet za pomocą modeli open-source; żaden serwis AI trzeciej strony nie widzi twojego dokumentu.
Markdown lub zwykły tekst
Poproś o output_format=markdown, aby zachować nagłówki i tabele ze stron cyfrowych, lub raw dla zwykłego tekstu.
Do 30 zeskanowanych stron na żądanie
Wystarczy dla większości listów, formularzy i raportów. Dłuższe skany: podziel plik lub przetwórz go w partiach przez API.
Przykłady zastosowań
Typowe scenariusze, w których to narzędzie oszczędza czas.
Archiwialne umowy i faktury
Uczyń lata zeskanowanej papierkowej roboty przeszukiwalną — wyodrębnij tekst raz i indeksuj go.
Dokumenty skanowane smartfonem
Aplikacje skanerów zapisują PDF-y zawierające tylko obrazy. Uruchom je przez OCR, aby skopiować adres, klauzulę lub razem.
Stare książki i raporty
Zamień zeskanowane strony na tekst do cytowania, tłumaczenia lub narzędzi dostępności.
Zasilanie skanów w AI
Claude i ChatGPT nie mogą niezawodnie odczytać zdjęcia strony. Najpierw OCR, potem wklej lub przepuść tekst.
Automatyzuj za pomocą API
Użyj tego samego narzędzia programistycznie. Działa z dowolnym językiem — wystarczy HTTP.
# Scanned pages are detected and OCR'd automatically curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...) curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Response metadata tells you which pages were recognized: # "metadata": { "ocr_pages": [1, 2, 3], ... }
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("scan.pdf", "rb")},
params={"output_format": "markdown"},
timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", [])) const formData = new FormData();
formData.append("file", pdfFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
{ method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []); Chcesz to zautomatyzować?
ParseJet API daje Ci tę samą moc parsowania przez jeden punkt końcowy HTTP. Bez ffmpeg, bez poppler, bez tesseract — tylko jedno wywołanie API.
Często zadawane pytania
Jak zastosować OCR do PDF-a?
Prześlij PDF powyżej. ParseJet patrzy na każdą stronę, rozpoznaje te, które są tylko obrazami, i pokazuje ci pełny tekst — zwykle w ciągu kilku sekund dla typowego listu lub formularza. Skopiuj go, lub zadzwoń do API, aby zrobić to samo dla wielu plików.
Jak wiem, czy mój PDF potrzebuje OCR?
Otwórz go i spróbuj zaznaczyć słowo. Jeśli nic się nie zaznacza, lub powiększenie powoduje, że litery wyglądają na pikselowe jak na zdjęciu, strona jest obrazem i potrzebuje OCR. PDF-y ze skanerów, faksów i aplikacji do skanowania smartfonów są prawie zawsze takie.
Czy dostaję przeszukiwalny PDF z powrotem?
Otrzymujesz tekst, nie nowy plik PDF. To jest to, czego potrzebujesz do kopiowania, wyszukiwania, indeksowania, tłumaczenia lub zasilania modelu AI. Jeśli konkretnie potrzebujesz oryginalnego PDF-a z dodaną niewidoczną warstwą tekstu, narzędzie pulpitowe takie jak OCRmyPDF to robi.
Czy jest limit stron?
Do 30 zeskanowanych stron jest rozpoznawanych na żądanie; strony, które już zawierają tekst, się nie liczą. W przypadku dłuższych skanów podziel plik lub wyślij go w częściach przez API. Metadane odpowiedzi wyświetlają rozpoznane strony i wszystkie, które zostały pominięte.
Które języki są obsługiwane?
Angielski i wszystkie języki ze znakami łacińskimi, chiński uproszczony i tradycyjny oraz japoński działają automatycznie. Dla koreańskiego, rosyjskiego i innych języków cyrylicy, arabskiego, hindi, tajskiego lub greckiego przekaż language=ko, ru, ar, hi, th, lub el (zlokalizowane wersje tej strony robią to za ciebie).
Czy to darmowe?
Tak. Trzy darmowe konwersje dziennie bez rejestracji, 300 kredytów miesięcznie z darmowym kontem i płatne plany od 19 USD/miesiąc dla większych plików i wyższych limitów.
Powiązane narzędzia
Image to Text — Free OCR (Optical Character Recognition)
Convert image to text online for free. OCR reads JPG, PNG, WebP and photos in 20+ languages and returns copy-ready text — no signup. API for developers too.
PDF to Text Converter
Convert PDF to text online for free. This PDF text converter handles multi-page files, scanned PDFs (OCR), and complex layouts. No signup — or automate via API.
Extract Text from PDF
Extract text from any PDF in seconds — digital or scanned. Drop the file, copy the text. Free, no signup, nothing to install; developers get the same via API.
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.
Zacznij bezpłatnie wyodrębniać tekst
Bez rejestracji. Przeanalizuj swój pierwszy plik w kilka sekund.