ParseJet

PDF OCR — Распознавание текста

Сканированный PDF — это просто картинки страниц: его нельзя искать, выделять и копировать текст из него. ParseJet распознает каждую страницу-изображение, применяет текстовое распознавание на собственных серверах и возвращает документ текстом, который можно искать, копировать и переиспользовать. Страницы, уже имеющие текстовый слой, извлекаются как есть, так что смешанные документы обрабатываются полностью.

Перетащите файл сюда или выберите

Принимает файлы PDF

Бесплатно — 3 запроса/день, без регистрации. для 300 кредитов/месяц бесплатно.

Как это работает

1

Загрузите отсканированный PDF

Перетащите файл выше — со сканера, мобильного приложения или факса. Цифровые PDF с текстовым слоем тоже работают.

2

Распознавание, страница за страницей

ParseJet проверяет каждую страницу. Страницы с текстом читаются прямо; страницы только с изображениями рендерятся и проходят OCR.

3

Скопируйте текст

Копируйте весь документ, или загружайте как Markdown или простой текст через API для поиска, таблиц или LLM.

Ключевые особенности

Что отличает этот pdf ocr.

Автоматическое определение нужных страниц

Ничего настраивать не нужно. Страница с менее чем парой десятков извлекаемых символов обрабатывается как скан; остальные сохраняют оригинальный текст.

20+ языков

Латинские языки, упрощённый и традиционный китайский, японский работают без настроек. Корейский, кириллица, арабский, деванагари, тайский и греческий работают с подсказкой языка.

Смешанные документы

Контракты с отсканированной подписью, отчёты со вставленными сканами — текст возвращается в порядке страниц с распознанными страницами на месте.

Никуда не выходит

Страницы рендерятся и распознаются на инфраструктуре ParseJet с открытыми моделями; никакой третьий API не видит ваш документ.

Markdown или простой текст

Запросите output_format=markdown, чтобы сохранить заголовки и таблицы с цифровых страниц, или raw для простого текста.

До 30 сканированных страниц за запрос

Достаточно для большинства писем, форм и отчётов. Более длинные сканы: разделите файл или обрабатывайте пакетно через API.

Примеры использования

Типичные сценарии, где этот инструмент экономит ваше время.

Архивные контракты и счета

Сделайте годы отсканированных документов поисковыми — извлеките текст один раз и индексируйте.

Документы со сканирования телефоном

Приложения для сканирования сохраняют только изображения. Запустите OCR, чтобы копировать адрес, пункт или сумму.

Старые книги и отчёты

Преобразуйте отсканированные страницы в текст для цитирования, перевода и доступности.

Загрузка сканов в AI

Claude и ChatGPT не могут надёжно читать фото страницы. Сначала распознайте OCR, потом вставляйте или передавайте текст.

Автоматизируйте с помощью API

Используйте тот же инструмент программно. Работает с любым языком — только HTTP.

cURL
# Scanned pages are detected and OCR'd automatically
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...)
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Response metadata tells you which pages were recognized:
# "metadata": { "ocr_pages": [1, 2, 3], ... }
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("scan.pdf", "rb")},
    params={"output_format": "markdown"},
    timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", []))
JavaScript
const formData = new FormData();
formData.append("file", pdfFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
  { method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []);

Хотите автоматизировать это?

ParseJet API предоставляет те же возможности парсинга через один HTTP-эндпоинт. Никакого ffmpeg, poppler или tesseract — всего один вызов API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Читать документацию API

Часто задаваемые вопросы

Как распознать PDF?

Загрузите PDF выше. ParseJet смотрит каждую страницу, распознает те, что только изображения, и показывает весь текст — обычно секунды для типичного письма или формы. Копируйте или вызывайте API для большого числа файлов.

Как узнать, нужен ли PDF OCR?

Откройте его и попробуйте выделить слово. Если ничего не подсвечивается или буквы при увеличении выглядят пиксельно как фото — страница изображение и нужен OCR. PDF со сканеров, факсов и мобильных приложений почти всегда такие.

Получу ли я поисковый PDF обратно?

Вы получите текст, не новый файл PDF. Это то, что нужно для копирования, поиска, индексирования, перевода и загрузки в AI. Если специально нужен исходный PDF с невидимым текстовым слоем, используйте инструмент OCRmyPDF на компьютере.

Есть ли ограничение на количество страниц?

До 30 сканированных страниц распознаются за запрос; страницы с текстом не считаются. Для более длинных сканов разделите файл или обрабатывайте через API. Метаданные ответа показывают, какие страницы распознаны и какие пропущены.

Какие языки поддерживаются?

Английский и все латинские языки, упрощённый и традиционный китайский, японский работают автоматически. Для корейского, русского и других кириллических, арабского, деванагари, тайского и греческого передайте language=ko, ru, ar, hi, th или el (локализованные версии этой страницы делают это за вас).

Это бесплатно?

Да. Три бесплатных распознавания в день без регистрации, 300 кредитов в месяц на бесплатном аккаунте, платные планы от $19/мес за большие файлы и высокие квоты.

Начните извлекать текст бесплатно

Регистрация не требуется. Обработайте первый файл за секунды.

Посмотреть тарифы