PDF OCR — スキャン PDF のテキスト認識
スキャン PDF はページの写真に過ぎません。検索、テキスト選択、コピーはできません。ParseJet の PDF OCR は各画像のみのページをレンダリングし、独自のサーバーでテキスト認識を実行して、検索、コピー、再利用できるドキュメントをテキストとして返します。テキストレイヤーがあるページは そのまま抽出されるため、混合ドキュメントは完全に出力されます。
ここにファイルをドロップするか、 参照
PDFファイルを受け付けます
無料 — 1日3リクエスト、登録不要。 して月300クレジットを無料で。
仕組み
スキャン PDF をアップロード
上でファイルをドロップしてください — スキャナー、スマートフォンスキャンアプリ、ファックスから。デジタル PDF でテキストレイヤーがあるものも動作します。
テキスト認識、ページごと
ParseJet がすべてのページをチェックします。テキストがあるページは直接読み取り、画像のみのページはレンダリングして OCR を通します。
テキストをコピー
ドキュメント全体をコピーするか、API を経由して Markdown またはプレーンテキストで取得して、検索、スプレッドシート、LLM に入力できます。
主な機能
このpdf ocrが際立つ理由。
OCR が必要なページを検出
設定不要。抽出可能な文字が 2 ダース未満のページはスキャンとして扱われ、認識されます。その他のページは元のテキストが保持されます。
20 以上の言語
ラテン文字言語、簡体字と繁体字中国語、日本語は設定不要。韓国語、キリル文字、アラビア語、ヒンディー語、タイ語、ギリシャ語は言語ヒントで動作します。
混合ドキュメント処理
スキャンされた署名ページを含む契約、挿入されたスキャンを含むレポート — テキストはページ順で返され、認識ページが組み込まれます。
何もサーバーから出ない
ページは ParseJet 独自インフラでレンダリング・認識され、オープンソースモデルを使用します。第三者の AI サービスはドキュメントを見ません。
Markdown またはプレーンテキスト
output_format=markdown を要求してデジタルページの見出しと表を保持するか、raw でプレーンテキストを取得してください。
1 回で最大 30 スキャンページ
ほとんどの手紙、フォーム、レポートに十分。より長いスキャン:ファイルを分割するか、API 経由でバッチ処理してください。
ユースケース
このツールが時間を節約する一般的なシナリオ。
アーカイブされた契約書と請求書
何年分のスキャン文書を検索可能にします — テキストを一度抽出してインデックス作成できます。
スマートフォンでスキャンした文書
スキャンアプリは画像のみ PDF を保存します。OCR で実行して、住所、条項、合計をコピーしてください。
古い本とレポート
スキャンページをテキストに変換して、引用、翻訳、アクセシビリティツールで使用できます。
スキャンを AI に入力
Claude と ChatGPT はページの写真を信頼して読めません。まず OCR を実行してからテキストを貼り付けるか、パイプに入力してください。
APIで自動化
同じツールをプログラムで使用。HTTPのみで、あらゆる言語で動作します。
# Scanned pages are detected and OCR'd automatically curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...) curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Response metadata tells you which pages were recognized: # "metadata": { "ocr_pages": [1, 2, 3], ... }
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("scan.pdf", "rb")},
params={"output_format": "markdown"},
timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", [])) const formData = new FormData();
formData.append("file", pdfFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
{ method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []); 自動化をお求めですか?
ParseJet APIは、単一のHTTPエンドポイントで同じ解析機能を提供します。ffmpeg、poppler、tesseractは不要。APIコール一つだけです。
よくある質問
PDF の OCR を実行するにはどうしますか?
上で PDF をアップロードしてください。ParseJet がすべてのページを見て、画像のみのものを認識し、完全なテキストを表示します — 通常、典型的な手紙やフォームは数秒以内に完了します。コピーするか、API を呼び出して多くのファイルでも同じことをできます。
PDF が OCR を必要とするかどうかわかりますか?
開いて単語を選択してみてください。何もハイライトされない、または拡大すると文字が写真のようにピクセル化される場合、ページは画像で OCR が必要です。スキャナー、ファックス機、スマートフォンスキャンアプリからの PDF はほぼ常にこのようなものです。
検索可能 PDF を取得しますか?
テキストを取得し、新しい PDF ファイルではありません。それはコピー、検索、インデックス作成、翻訳、AI モデルへの入力に必要なものです。具体的に目に見えないテキストレイヤーを追加した元の PDF が必要な場合、OCRmyPDF のようなデスクトップツールがそれを行います。
ページ制限はありますか?
1 回のリクエストで最大 30 スキャンページが認識されます。テキストが既に含まれるページはカウントされません。より長いスキャンの場合、ファイルを分割するか、API 経由で分割して送信してください。レスポンスメタデータは認識されたページと スキップされたページを一覧表示します。
どの言語がサポートされていますか?
英語とすべてのラテン文字言語、簡体字と繁体字中国語、日本語は自動で動作します。韓国語、ロシアおよび他のキリル文字、アラビア語、ヒンディー語、タイ語、ギリシャ語は、language=ko、ru、ar、hi、th、or el を渡してください(このページのローカライズ版が行います)。
無料ですか?
はい。サインアップなしで 1 日 3 回の無料変換、無料アカウントで月 300 クレジット、有料プランは月額 19 ドルからで、より大きなファイルと高いクォータを提供します。
関連ツール
Image to Text — Free OCR (Optical Character Recognition)
Convert image to text online for free. OCR reads JPG, PNG, WebP and photos in 20+ languages and returns copy-ready text — no signup. API for developers too.
PDF to Text Converter
Convert PDF to text online for free. This PDF text converter handles multi-page files, scanned PDFs (OCR), and complex layouts. No signup — or automate via API.
Extract Text from PDF
Extract text from any PDF in seconds — digital or scanned. Drop the file, copy the text. Free, no signup, nothing to install; developers get the same via API.
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.