PDF OCR — 掃描PDF文字辨識
掃描 PDF 就是頁面的圖片:無法搜尋、無法選文字、無法複製。ParseJet 的 PDF OCR 對每個純影象頁面進行字元辨識,在我們自己的伺服器上執行,返回你可以搜尋、複製、重複使用的文字。已有文字層的頁面直接擷取,所以混合文件也能完整返回。
將檔案拖放到此處或 瀏覽
接受 PDF 檔案
免費 — 每日 3 次請求,無需註冊。 即可獲得每月 300 點免費額度。
運作原理
上傳掃描 PDF
拖放掃描器產生的檔案、手機掃描應用或傳真的 PDF。也支援有文字層的數位 PDF。
逐頁文字辨識
ParseJet 檢查每一頁。有文字的頁面直接讀取;純影象頁面進行渲染並透過 OCR 處理。
複製文字
複製整個文件,或透過 API 以 Markdown 或純文字格式獲取,用於搜尋、電子表格或 LLM。
主要功能
這個 pdf ocr 的突出之處。
自動檢測哪些頁面需要 OCR
無需設定。少於幾十個可擷取字元的頁面被視為掃描檔並進行辨識;其他所有頁面保留原始文字。
20+ 種語言
拉丁文字、簡體和繁體中文、日文無需設定。韓文、西里爾文、阿拉伯文、印地文、泰文和希臘文掃描檔需要一個語言提示。
混合文件處理
有掃描簽名頁的合同、插入掃描檔的報告——文字按頁序返回,辨識的頁面自動拼接。
不離開我們的伺服器
頁面在 ParseJet 自己的基礎設施上進行渲染和辨識,使用開源模型;任何第三方 AI 服務都看不到你的文件。
Markdown 或純文字
請求 output_format=markdown 以保留數位頁面的標題和表格,或 raw 獲取純文字。
單次請求最多 30 個掃描頁面
足以處理大多數信件、表單和報告。更長的掃描檔:分割檔案或透過 API 分批處理。
使用案例
此工具為您節省時間的常見情境。
存檔合同和發票
讓多年的掃描檔案變得可搜尋——擷取文字一次並建立索引。
手機掃描的文件
掃描應用儲存純影象 PDF。透過 OCR 執行它們以複製地址、條款或總數。
舊書和報告
將掃描頁面轉換為文字,用於引用、翻譯或無障礙工具。
將掃描檔輸入 AI
Claude 和 ChatGPT 無法可靠地讀取頁面照片。先進行 OCR,再貼上或輸入文字。
使用 API 自動化
以程式化方式使用相同工具。適用於任何語言 — 僅需 HTTP。
# Scanned pages are detected and OCR'd automatically curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...) curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Response metadata tells you which pages were recognized: # "metadata": { "ocr_pages": [1, 2, 3], ... }
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("scan.pdf", "rb")},
params={"output_format": "markdown"},
timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", [])) const formData = new FormData();
formData.append("file", pdfFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
{ method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []); 常見問題
如何對 PDF 進行 OCR?
在上方上傳 PDF。ParseJet 檢視每一頁,辨識純影象的頁面,並顯示完整文字——通常在幾秒鐘內完成一份典型的信件或表單。複製它,或呼叫 API 對許多檔案執行相同操作。
我怎樣知道我的 PDF 是否需要 OCR?
開啟它並嘗試選中一個單詞。如果沒有突出顯示,或放大後字母看起來像照片一樣畫素化,那麼頁面是影象,需要 OCR。來自掃描器、傳真機和手機掃描應用的 PDF 幾乎總是這樣。
能得到可搜尋的 PDF 返回嗎?
你得到的是文字,不是新的 PDF 檔案。這是你複製、搜尋、索引、翻譯或輸入 AI 模型所需的。如果你特別需要原始 PDF 加上隱形文字層,OCRmyPDF 等桌面工具可以做到。
有頁面限制嗎?
單次請求最多辨識 30 個掃描頁面;已包含文字的頁面不計入限制。對於更長的掃描檔,分割檔案或透過 API 分部分傳送。響應後設資料列出辨識的頁面和跳過的頁面。
支援哪些語言?
英文和所有拉丁文字、簡體和繁體中文、日文自動支援。對於韓文、俄文和其他西里爾文字、阿拉伯文、印地文、泰文或希臘文,傳遞 language=ko、ru、ar、hi、th 或 el(本頁面的本地化版本已為你設定)。
這是免費的嗎?
是的。無需註冊每天免費 3 次,免費帳號每月 300 點數,付費計劃從 19 美元/月起,支援更大的檔案和更高的配額。
相關工具
Image to Text — Free OCR (Optical Character Recognition)
Convert image to text online for free. OCR reads JPG, PNG, WebP and photos in 20+ languages and returns copy-ready text — no signup. API for developers too.
PDF to Text Converter
Convert PDF to text online for free. This PDF text converter handles multi-page files, scanned PDFs (OCR), and complex layouts. No signup — or automate via API.
Extract Text from PDF
Extract text from any PDF in seconds — digital or scanned. Drop the file, copy the text. Free, no signup, nothing to install; developers get the same via API.
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.