ParseJet

OCR API — Ekstrak Teks dari Gambar dengan Satu Permintaan

Tambahkan pengenalan karakter optik ke aplikasi Anda dengan satu panggilan HTTP. Kirim JPG, PNG, WebP, atau PDF pindaian ke API OCR ParseJet dan dapatkan teks bersih plus metadata kembali sebagai JSON — tidak ada Tesseract untuk dikompilasi, tidak ada file model untuk dikelola, tidak ada GPU. Gratis untuk memulai dengan 300 permintaan per bulan; cobakan di gambar di sini.

Letakkan file di sini atau telusuri

Menerima file JPG,JPEG,PNG,GIF,WEBP,TIFF,BMP,PDF

Gratis — 3 permintaan/hari, tanpa pendaftaran. untuk 300 kredit/bulan gratis.

Cara kerjanya

1

Dapatkan kunci API gratis

Daftar, buat kunci di dasbor, dan Anda memiliki 300 permintaan per bulan. Tidak ada kunci sama sekali memberi Anda 3 permintaan per hari untuk pengujian cepat.

2

POST gambarnya

Satu permintaan multipart ke /v1/parse/image/ocr — atau /v1/parse/auto/file jika Anda juga mengirim PDF dan dokumen lain melalui jalur kode yang sama.

3

Gunakan JSON

Respons memiliki teks, judul, tipe sumber, dan metadata seperti ukuran gambar, jumlah baris, dan skor kepercayaan rata-rata.

Fitur utama

Apa yang membuat ocr api ini menonjol.

Satu endpoint, bahasa apa pun

HTTP biasa dengan unggahan multipart: Python, JavaScript, Go, PHP, Ruby, Swift, curl dalam cronjob — apa pun yang dapat POST file.

SDK Resmi

pip install parsejet atau npm install parsejet dan hubungi client.parse.ocr() — percobaan ulang, kesalahan, dan pengetikan ditangani untuk Anda.

20+ bahasa

Skrip Latin, Cina, dan Jepang dibaca secara otomatis; lewatkan bahasa=ko, ru, ar, hi, th, atau el untuk Korea, Sirilik, Arab, Devanagari, Thai, atau Yunani.

PDF pindaian juga

Kirim PDF ke /v1/parse/auto/file dan halaman hanya gambar secara otomatis di-OCR (hingga 30 per permintaan), dengan nomor halaman yang dikenali dalam metadata.

JSON yang dapat diprediksi

Setiap respons memiliki bentuk yang sama: teks, judul, source_type, metadata. Kepercayaan ada di metadata.ocr_confidence sehingga Anda dapat merutekan hasil kepercayaan rendah ke manusia.

Model yang di-host sendiri, tidak ada AI pihak ketiga

Pengenalan berjalan pada infrastruktur ParseJet dengan model PP-OCR sumber terbuka. Gambar diproses dalam memori dan tidak disimpan — kepatuhan lebih sederhana daripada mengirim dokumen pelanggan ke API visi cloud besar.

Kasus penggunaan

Skenario umum di mana alat ini menghemat waktu Anda.

Penangkapan kuitansi dan faktur

Baca total, tanggal, dan nama vendor dari foto yang diunggah pengguna, lalu validasi dalam kode Anda sendiri.

Moderasi dan pencarian tangkapan layar

Ekstrak teks dari gambar yang dikirimkan pengguna sehingga dapat dicari, disaring, atau diperiksa terhadap aturan.

Penyerapan dokumen untuk RAG

OCR halaman pindaian dan gambar bersama PDF dan DOCX melalui satu API sebelum chunking dan embedding.

Backend aplikasi seluler

Simpan aplikasi tetap kecil: kirim foto ke API alih-alih mengirimkan model OCR di-perangkat.

Mengganti Tesseract di serverless

Tidak ada biner asli atau paket bahasa untuk dibundel ke dalam Lambda, Vercel, atau fungsi Cloudflare — hanya panggilan HTTP.

Otomatisasi dengan API

Gunakan alat yang sama secara terprogram. Bekerja dengan bahasa apa pun — cukup HTTP.

Python
# pip install httpx
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/image/ocr",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("receipt.jpg", "rb")},
    data={"language": "en"},     # optional hint: ko, ru, ar, hi, th, el ...
    timeout=60,
)
resp.raise_for_status()
result = resp.json()
print(result["text"])
if result["metadata"]["ocr_confidence"] < 0.8:
    print("low confidence — send for manual review")

# Batch a folder of scans
from pathlib import Path
for img in Path("scans").glob("*.png"):
    r = httpx.post(
        "https://api.parsejet.com/v1/parse/image/ocr",
        headers={"Authorization": "Bearer YOUR_API_KEY"},
        files={"file": (img.name, img.read_bytes(), "image/png")},
    )
    print(img.name, r.json()["text"][:80])
JavaScript / Node
// npm install parsejet
import { ParseJet } from "parsejet";
import { readFile } from "node:fs/promises";

const client = new ParseJet({ apiKey: process.env.PARSEJET_API_KEY });
const image = await readFile("receipt.jpg");
const result = await client.parse.ocr(image, "receipt.jpg");
console.log(result.text);

// Or plain fetch, in any runtime:
const form = new FormData();
form.append("file", new Blob([image]), "receipt.jpg");
const res = await fetch("https://api.parsejet.com/v1/parse/image/ocr", {
  method: "POST",
  headers: { Authorization: `Bearer ${process.env.PARSEJET_API_KEY}` },
  body: form,
});
const { text, metadata } = await res.json();
cURL
# No API key: 3 requests/day for testing
curl -X POST https://api.parsejet.com/v1/parse/image/ocr \
  -F "[email protected]"

# With a key (300 free requests/month), Korean text
curl -X POST https://api.parsejet.com/v1/parse/image/ocr \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]" -F "language=ko"

# Response
# {
#   "text": "...",
#   "title": "menu",
#   "source_type": "image_ocr",
#   "metadata": { "width": 1280, "height": 960, "ocr_lines": 14, "ocr_confidence": 0.96 }
# }

Ingin mengotomatiskan ini?

ParseJet API memberikan kemampuan parsing yang sama melalui satu endpoint HTTP. Tanpa ffmpeg, tanpa poppler, tanpa tesseract — cukup satu panggilan API.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
Baca Dokumentasi API

Pertanyaan yang sering diajukan

Apakah ada OCR API gratis?

Ya. Tanpa kunci apa pun, Anda dapat membuat 3 permintaan per hari, yang cukup untuk pengujian. Akun gratis memberi Anda kunci API dengan 300 kredit per bulan (satu gambar = satu kredit). Paket berbayar mulai dari $19/bulan untuk batas lebih tinggi dan file lebih besar.

Bagaimana cara menggunakan OCR API di Python?

POST gambar sebagai data formulir multipart ke /v1/parse/image/ocr dengan kunci Anda di header Otorisasi — tiga baris dengan httpx atau permintaan, ditunjukkan di atas. Teks ada di bidang "text" dari respons JSON. Paket parsejet di PyPI membungkus panggilan yang sama dengan percobaan ulang dan hasil yang diketik.

Seberapa akuratnya?

API menggunakan model pengenalan PP-OCR, keluarga yang sama yang memberdayakan banyak sistem OCR produksi. Teks cetak, tangkapan layar, dan pindaian bersih kembali dengan akurasi sangat tinggi; setiap respons membawa skor kepercayaan rata-rata yang dapat Anda ambang. Tulisan tangan dan foto buram mendapat skor lebih rendah.

Bahasa apa yang didukung?

Bahasa Inggris dan semua bahasa dengan aksara Latin, Cina Sederhana dan Tradisional, dan Jepang tidak memerlukan parameter. Kirim bahasa=ko, ru (atau uk, bg…), ar (atau fa, ur), hi, th, atau el untuk Korea, Sirilik, Arab, Devanagari, Thai, atau Yunani.

Apa batasannya?

Gambar hingga 20 MB, PDF hingga 200 MB pada paket berbayar (2 MB tanpa kunci, 5 MB pada akun gratis). Permintaan per menit tergantung pada rencananya. PDF pindaian mengenali hingga 30 halaman gambar per permintaan.

Apakah Anda menyimpan gambar saya?

Tidak. File diproses dalam memori di server ParseJet dengan model sumber terbuka dan dibuang saat respons dikirim. Mereka tidak diteruskan ke penyedia AI pihak ketiga dan tidak digunakan untuk pelatihan.

Apa perbedaannya dari Tesseract?

Tesseract gratis untuk dijalankan sendiri tetapi Anda memiliki biner, paket bahasa, pra-pemrosesan gambar, dan penyetelan akurasi — dan berjuang dengan foto dan teks CJK. API ParseJet memberi Anda OCR pembelajaran mendalam modern di balik satu panggilan HTTP, dengan bentuk JSON yang sama seperti parser ParseJet lainnya.

Mulai ekstraksi teks secara gratis

Tidak perlu mendaftar. Parse file pertama Anda dalam hitungan detik.

Lihat Harga