PDF OCR — Pengenalan Teks untuk PDF Pindaian
PDF pindaian hanyalah gambar halaman: Anda tidak dapat mencarinya, memilih teks, atau menyalin darinya. PDF OCR ParseJet merender setiap halaman hanya gambar, menjalankan pengenalan teks di server kami sendiri, dan mengembalikan dokumen sebagai teks yang dapat Anda cari, salin, dan gunakan kembali. Halaman yang sudah memiliki lapisan teks diekstrak apa adanya, jadi dokumen campuran keluar lengkap.
Letakkan file di sini atau telusuri
Menerima file PDF
Gratis — 3 permintaan/hari, tanpa pendaftaran. untuk 300 kredit/bulan gratis.
Cara kerjanya
Unggah PDF pindaian
Lepas file di atas — dari pemindai, aplikasi pemindai ponsel, atau faks. PDF digital dengan lapisan teks juga berfungsi.
Pengenalan teks, halaman demi halaman
ParseJet memeriksa setiap halaman. Halaman dengan teks nyata dibaca langsung; halaman hanya gambar dirender dan dilewatkan melalui OCR.
Salin teksnya
Salin seluruh dokumen, atau ambilnya sebagai Markdown atau teks biasa melalui API untuk memberi makan pencarian, spreadsheet, atau LLM.
Fitur utama
Apa yang membuat pdf ocr ini menonjol.
Mendeteksi halaman mana yang memerlukan OCR
Tidak ada yang perlu dikonfigurasi. Halaman dengan kurang dari beberapa lusin karakter yang dapat diekstrak diperlakukan sebagai pindaian dan dikenali; setiap halaman lain menyimpan teks aslinya.
20+ bahasa
Bahasa dengan aksara Latin, Cina Sederhana dan Tradisional, dan Jepang tidak memerlukan pengaturan. Pindaian Korea, Sirilik, Arab, Hindi, Thai, dan Yunani bekerja dengan petunjuk bahasa.
Dokumen campuran ditangani
Kontrak dengan halaman tanda tangan pindaian, laporan dengan pindaian yang disisipi — teks keluar dalam urutan halaman dengan halaman yang dikenali tersambung.
Tidak ada yang meninggalkan server kami
Halaman dirender dan dikenali pada infrastruktur ParseJet sendiri dengan model sumber terbuka; tidak ada layanan AI pihak ketiga yang melihat dokumen Anda.
Markdown atau teks biasa
Minta output_format=markdown untuk mempertahankan judul dan tabel dari halaman digital, atau raw untuk teks biasa.
Hingga 30 halaman pindaian per permintaan
Cukup untuk sebagian besar surat, formulir, dan laporan. Pindaian lebih panjang: pisahkan file, atau prosesnya dalam batch melalui API.
Kasus penggunaan
Skenario umum di mana alat ini menghemat waktu Anda.
Kontrak dan faktur yang diarsipkan
Buat tahun-tahun pekerjaan pindaian dapat dicari — ekstrak teks sekali dan indeksnya.
Dokumen yang dipindai ponsel
Aplikasi pemindai menyimpan PDF hanya gambar. Jalankan mereka melalui OCR untuk menyalin alamat, klausul, atau total.
Buku dan laporan lama
Ubah halaman pindaian menjadi teks untuk kutipan, terjemahan, atau alat aksesibilitas.
Memberi makan pindaian ke AI
Claude dan ChatGPT tidak dapat membaca gambar halaman secara andal. OCR terlebih dahulu, lalu tempel atau pipa teksnya.
Otomatisasi dengan API
Gunakan alat yang sama secara terprogram. Bekerja dengan bahasa apa pun — cukup HTTP.
# Scanned pages are detected and OCR'd automatically curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...) curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Response metadata tells you which pages were recognized: # "metadata": { "ocr_pages": [1, 2, 3], ... }
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("scan.pdf", "rb")},
params={"output_format": "markdown"},
timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", [])) const formData = new FormData();
formData.append("file", pdfFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
{ method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []); Ingin mengotomatiskan ini?
ParseJet API memberikan kemampuan parsing yang sama melalui satu endpoint HTTP. Tanpa ffmpeg, tanpa poppler, tanpa tesseract — cukup satu panggilan API.
Pertanyaan yang sering diajukan
Bagaimana cara melakukan OCR pada PDF?
Unggah PDF di atas. ParseJet melihat setiap halaman, mengenali yang hanya gambar, dan menunjukkan Anda teks lengkap — biasanya dalam beberapa detik untuk surat atau formulir khas. Salin, atau hubungi API untuk melakukan hal yang sama untuk banyak file.
Bagaimana cara mengetahui apakah PDF saya memerlukan OCR?
Buka dan coba pilih kata. Jika tidak ada yang menyoroti, atau memperbesar membuat huruf terlihat seperti piksel dalam foto, halamannya adalah gambar dan memerlukan OCR. PDF dari pemindai, mesin faks, dan aplikasi pemindai ponsel hampir selalu seperti ini.
Apakah saya mendapatkan PDF yang dapat dicari kembali?
Anda mendapatkan teks, bukan file PDF baru. Itulah yang Anda butuhkan untuk menyalin, mencari, mengindeks, menerjemahkan, atau memberi makan model AI. Jika Anda khususnya memerlukan PDF asli dengan lapisan teks tak terlihat ditambahkan, alat desktop seperti OCRmyPDF melakukan itu.
Apakah ada batas halaman?
Hingga 30 halaman pindaian dikenali per permintaan; halaman yang sudah berisi teks tidak dihitung. Untuk pindaian lebih panjang, pisahkan file atau kirimkan dalam bagian melalui API. Metadata respons mencantumkan halaman yang dikenali dan yang dilewati.
Bahasa mana yang didukung?
Bahasa Inggris dan semua bahasa dengan aksara Latin, Cina Sederhana dan Tradisional, dan Jepang bekerja secara otomatis. Untuk Korea, Rusia dan bahasa Sirilik lainnya, Arab, Hindi, Thai, atau Yunani, lewatkan bahasa=ko, ru, ar, hi, th, atau el (versi terlokalisasi dari halaman ini melakukannya untuk Anda).
Apakah gratis?
Ya. Tiga konversi gratis per hari tanpa mendaftar, 300 kredit sebulan dengan akun gratis, dan paket berbayar dari $19/bulan untuk file lebih besar dan kuota lebih tinggi.
Alat terkait
Image to Text — Free OCR (Optical Character Recognition)
Convert image to text online for free. OCR reads JPG, PNG, WebP and photos in 20+ languages and returns copy-ready text — no signup. API for developers too.
PDF to Text Converter
Convert PDF to text online for free. This PDF text converter handles multi-page files, scanned PDFs (OCR), and complex layouts. No signup — or automate via API.
Extract Text from PDF
Extract text from any PDF in seconds — digital or scanned. Drop the file, copy the text. Free, no signup, nothing to install; developers get the same via API.
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.
Mulai ekstraksi teks secara gratis
Tidak perlu mendaftar. Parse file pertama Anda dalam hitungan detik.