PDF OCR — 스캔 PDF 텍스트 인식
스캔 PDF는 페이지 사진일 뿐입니다: 검색할 수 없고, 텍스트를 선택할 수 없고, 복사할 수 없습니다. ParseJet의 PDF OCR이 각 이미지 전용 페이지를 렌더링하고, 자체 서버에서 텍스트 인식을 실행한 후, 검색하고 복사하고 재사용할 수 있는 텍스트로 문서를 반환합니다. 텍스트 레이어가 이미 있는 페이지는 그대로 추출되므로, 혼합 문서도 완전하게 나옵니다.
여기에 파일을 끌어다 놓거나 찾아보기
PDF 파일 지원
무료 — 하루 3회 요청, 가입 불필요. 하면 월 300 크레딧 무료.
작동 방식
스캔 PDF 업로드
위에 파일을 드롭합니다 — 스캐너에서든, 휴대폰 스캔 앱이든, 팩스든요. 텍스트 레이어가 있는 디지털 PDF도 작동합니다.
페이지별 텍스트 인식
ParseJet이 모든 페이지를 확인합니다. 실제 텍스트가 있는 페이지는 직접 읽혀지고, 이미지 전용 페이지는 렌더링되어 OCR을 거칩니다.
텍스트 복사
전체 문서를 복사하거나, API로 Markdown이나 일반 텍스트로 가져와서 검색, 스프레드시트, LLM에 입력합니다.
주요 기능
이 pdf ocr가 돋보이는 이유.
어떤 페이지가 OCR이 필요한지 감지
설정할 것이 없습니다. 추출 가능한 문자가 두어 개 미만인 페이지는 스캔으로 취급해서 인식되고, 다른 모든 페이지는 원본 텍스트를 유지합니다.
20개 이상 언어
라틴 문자 언어, 간체/정체 중국어, 일본어는 설정이 없습니다. 한국어, 키릴 문자, 아랍어, 힌디어, 태국어, 그리스어 스캔본은 언어 힌트와 함께 작동합니다.
혼합 문서 처리
서명 페이지가 스캔인 계약서, 스캔본이 삽입된 보고서 — 텍스트가 페이지 순서대로 돌아오고 인식된 페이지가 끼워집니다.
서버를 벗어나는 데이터 없음
페이지를 렌더링하고 인식하는 것이 ParseJet 인프라에서만 이루어지고 오픈소스 모델을 씁니다. 문서는 제3자 AI 서비스를 절대 봅니다.
Markdown이나 일반 텍스트
output_format=markdown을 요청하면 디지털 페이지의 제목과 표가 유지되고, raw면 일반 텍스트입니다.
요청당 최대 30개 스캔 페이지
대부분의 편지, 양식, 보고서에 충분합니다. 더 긴 스캔본은 파일을 나누거나 API로 일괄 처리합니다.
사용 사례
이 도구가 시간을 절약해주는 일반적인 시나리오.
보관 계약서와 송장
수년의 스캔 서류를 검색 가능하게 만듭니다 — 텍스트를 한 번 추출하고 색인을 만듭니다.
휴대폰 스캔 문서
스캔 앱이 이미지 전용 PDF를 저장합니다. OCR을 실행하면 주소, 절, 합계를 복사할 수 있습니다.
옛날 책과 보고서
스캔 페이지를 텍스트로 바꿔서 인용, 번역, 또는 접근성 도구에 씁니다.
스캔본을 AI에 입력
Claude와 ChatGPT는 페이지 사진을 안정적으로 읽을 수 없습니다. 먼저 OCR 처리한 후 텍스트를 붙여넣거나 입력합니다.
API로 자동화
동일한 도구를 프로그래밍 방식으로 사용하세요. 모든 언어와 호환 — 단순히 HTTP입니다.
# Scanned pages are detected and OCR'd automatically curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...) curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Response metadata tells you which pages were recognized: # "metadata": { "ocr_pages": [1, 2, 3], ... }
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("scan.pdf", "rb")},
params={"output_format": "markdown"},
timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", [])) const formData = new FormData();
formData.append("file", pdfFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
{ method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []); 자동화하고 싶으신가요?
ParseJet API는 단일 HTTP 엔드포인트를 통해 동일한 파싱 기능을 제공합니다. ffmpeg, poppler, tesseract 없이 — 단 한 번의 API 호출만으로 가능합니다.
자주 묻는 질문
PDF를 어떻게 OCR 처리하나요?
위에 PDF를 업로드합니다. ParseJet이 모든 페이지를 보고 이미지 전용 페이지를 인식하고 전체 텍스트를 표시합니다 — 보통 편지나 양식은 몇 초 안에요. 복사하거나, API로 많은 파일에 같은 작업을 합니다.
PDF가 OCR이 필요한지 어떻게 알 수 있나요?
PDF를 열고 단어를 선택해 봅니다. 아무것도 강조되지 않거나 확대하면 글자가 사진처럼 픽셀화되어 보이면 이미지이고 OCR이 필요합니다. 스캐너, 팩스 기계, 휴대폰 스캔 앱의 PDF는 거의 항상 이렇습니다.
텍스트 레이어가 있는 새 PDF를 다시 받나요?
텍스트를 받습니다. 새 PDF 파일이 아닙니다. 복사, 검색, 색인, 번역, AI 모델 입력에 필요한 것입니다. 구체적으로 텍스트 레이어가 보이지 않게 추가된 원본 PDF가 필요하면, OCRmyPDF 같은 데스크톱 도구를 씁니다.
페이지 제한이 있나요?
요청당 최대 30개 스캔 페이지를 인식합니다. 이미 텍스트가 있는 페이지는 카운트되지 않습니다. 더 긴 스캔본은 파일을 나누거나 API로 부분별로 보냅니다. 응답 메타데이터는 인식된 페이지와 건너뛴 페이지를 나열합니다.
어떤 언어를 지원하나요?
영어, 모든 라틴 문자 언어, 간체/정체 중국어, 일본어는 자동으로 작동합니다. 한국어, 러시아 및 기타 키릴 문자, 아랍어, 힌디어, 태국어, 그리스어는 language=ko, ru, ar, hi, th, el을 보냅니다 — 이 페이지의 지역화 버전이 당신을 위해 합니다.
무료인가요?
네. 하루에 3번 무료 변환을 받고, 무료 계정으로 월 300 크레딧을 받고, 유료 플랜은 더 큰 파일과 더 높은 할당량으로 월 $19부터 시작합니다.
관련 도구
Image to Text — Free OCR (Optical Character Recognition)
Convert image to text online for free. OCR reads JPG, PNG, WebP and photos in 20+ languages and returns copy-ready text — no signup. API for developers too.
PDF to Text Converter
Convert PDF to text online for free. This PDF text converter handles multi-page files, scanned PDFs (OCR), and complex layouts. No signup — or automate via API.
Extract Text from PDF
Extract text from any PDF in seconds — digital or scanned. Drop the file, copy the text. Free, no signup, nothing to install; developers get the same via API.
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.