ParseJet

PDF OCR — スキャン PDF のテキスト認識

スキャン PDF はページの写真に過ぎません。検索、テキスト選択、コピーはできません。ParseJet の PDF OCR は各画像のみのページをレンダリングし、独自のサーバーでテキスト認識を実行して、検索、コピー、再利用できるドキュメントをテキストとして返します。テキストレイヤーがあるページは そのまま抽出されるため、混合ドキュメントは完全に出力されます。

ここにファイルをドロップするか、 参照

PDFファイルを受け付けます

無料 — 1日3リクエスト、登録不要。 して月300クレジットを無料で。

仕組み

1

スキャン PDF をアップロード

上でファイルをドロップしてください — スキャナー、スマートフォンスキャンアプリ、ファックスから。デジタル PDF でテキストレイヤーがあるものも動作します。

2

テキスト認識、ページごと

ParseJet がすべてのページをチェックします。テキストがあるページは直接読み取り、画像のみのページはレンダリングして OCR を通します。

3

テキストをコピー

ドキュメント全体をコピーするか、API を経由して Markdown またはプレーンテキストで取得して、検索、スプレッドシート、LLM に入力できます。

主な機能

このpdf ocrが際立つ理由。

OCR が必要なページを検出

設定不要。抽出可能な文字が 2 ダース未満のページはスキャンとして扱われ、認識されます。その他のページは元のテキストが保持されます。

20 以上の言語

ラテン文字言語、簡体字と繁体字中国語、日本語は設定不要。韓国語、キリル文字、アラビア語、ヒンディー語、タイ語、ギリシャ語は言語ヒントで動作します。

混合ドキュメント処理

スキャンされた署名ページを含む契約、挿入されたスキャンを含むレポート — テキストはページ順で返され、認識ページが組み込まれます。

何もサーバーから出ない

ページは ParseJet 独自インフラでレンダリング・認識され、オープンソースモデルを使用します。第三者の AI サービスはドキュメントを見ません。

Markdown またはプレーンテキスト

output_format=markdown を要求してデジタルページの見出しと表を保持するか、raw でプレーンテキストを取得してください。

1 回で最大 30 スキャンページ

ほとんどの手紙、フォーム、レポートに十分。より長いスキャン:ファイルを分割するか、API 経由でバッチ処理してください。

ユースケース

このツールが時間を節約する一般的なシナリオ。

アーカイブされた契約書と請求書

何年分のスキャン文書を検索可能にします — テキストを一度抽出してインデックス作成できます。

スマートフォンでスキャンした文書

スキャンアプリは画像のみ PDF を保存します。OCR で実行して、住所、条項、合計をコピーしてください。

古い本とレポート

スキャンページをテキストに変換して、引用、翻訳、アクセシビリティツールで使用できます。

スキャンを AI に入力

Claude と ChatGPT はページの写真を信頼して読めません。まず OCR を実行してからテキストを貼り付けるか、パイプに入力してください。

APIで自動化

同じツールをプログラムで使用。HTTPのみで、あらゆる言語で動作します。

cURL
# Scanned pages are detected and OCR'd automatically
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...)
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Response metadata tells you which pages were recognized:
# "metadata": { "ocr_pages": [1, 2, 3], ... }
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("scan.pdf", "rb")},
    params={"output_format": "markdown"},
    timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", []))
JavaScript
const formData = new FormData();
formData.append("file", pdfFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
  { method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []);

自動化をお求めですか?

ParseJet APIは、単一のHTTPエンドポイントで同じ解析機能を提供します。ffmpeg、poppler、tesseractは不要。APIコール一つだけです。

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
APIドキュメントを読む

よくある質問

PDF の OCR を実行するにはどうしますか?

上で PDF をアップロードしてください。ParseJet がすべてのページを見て、画像のみのものを認識し、完全なテキストを表示します — 通常、典型的な手紙やフォームは数秒以内に完了します。コピーするか、API を呼び出して多くのファイルでも同じことをできます。

PDF が OCR を必要とするかどうかわかりますか?

開いて単語を選択してみてください。何もハイライトされない、または拡大すると文字が写真のようにピクセル化される場合、ページは画像で OCR が必要です。スキャナー、ファックス機、スマートフォンスキャンアプリからの PDF はほぼ常にこのようなものです。

検索可能 PDF を取得しますか?

テキストを取得し、新しい PDF ファイルではありません。それはコピー、検索、インデックス作成、翻訳、AI モデルへの入力に必要なものです。具体的に目に見えないテキストレイヤーを追加した元の PDF が必要な場合、OCRmyPDF のようなデスクトップツールがそれを行います。

ページ制限はありますか?

1 回のリクエストで最大 30 スキャンページが認識されます。テキストが既に含まれるページはカウントされません。より長いスキャンの場合、ファイルを分割するか、API 経由で分割して送信してください。レスポンスメタデータは認識されたページと スキップされたページを一覧表示します。

どの言語がサポートされていますか?

英語とすべてのラテン文字言語、簡体字と繁体字中国語、日本語は自動で動作します。韓国語、ロシアおよび他のキリル文字、アラビア語、ヒンディー語、タイ語、ギリシャ語は、language=ko、ru、ar、hi、th、or el を渡してください(このページのローカライズ版が行います)。

無料ですか?

はい。サインアップなしで 1 日 3 回の無料変換、無料アカウントで月 300 クレジット、有料プランは月額 19 ドルからで、より大きなファイルと高いクォータを提供します。

無料でテキスト抽出を始める

サインアップ不要。数秒で最初のファイルを解析。

料金を見る