ParseJet

PDF OCR — skanerlangan PDF-lardan matn tanib olish

Skanerlangan PDF — bu sahifalar rasmidek: undan matnni qidira olmaysiz, tanlaya olmaysiz, nusxala olmaysiz. ParseJet'ning PDF OCR xizmati har bir rasmga asoslangan sahifani tahlil qiladi, matn tanib olishni o'z serverlarida ishga tushiradi va hujjatni qidirish, nusxalash va qayta foydalanish mumkin bo'lgan matnga aylantiradib qaytaradi. Allaqachon matn qatlami bo'lgan sahifalar o'z holida o'qiladi, shuning uchun aralash hujjatlar butunlay tugaydi.

Faylni bu erga tashlang yoki ko‘rib chiqing

PDF fayllarni qabul qiladi

Bepul — kuniga 3 so‘rov, ro‘yxatdan o‘tish shart emas. oyiga 300 kredit bepul olish uchun.

Qanday ishlaydi

1

Skanerlangan PDF'ni yuklang

Faylni tashlang — skalerdan, telefon skanerlash ilovasidan yoki faksdan. Matn qatlami bo'lgan raqamli PDF'lar ham ishlaydi.

2

Matn tanib olish, sahifa bo'yicha

ParseJet har bir sahifani tekshiradi. Haqiqiy matnga ega sahifalar to'g'ridan-to'g'ri o'qiladi; faqat rasmlarga asoslangan sahifalar OCR orqali qayta ishlanadi.

3

Matnni nusxalang

Butun hujjatni nusxalang yoki API orqali Markdown yoki oddiy matn sifatida oling, qidirish, jadvallar yoki LLM'ga yuborish uchun.

Asosiy xususiyatlar

Bu pdf ocr ni nima ajralib turadigan qiladi.

Qaysi sahifalar OCR talab qilishini aniqlaydi

Sozlashga shart emas. Bitta-ikki o'nlik chiqaradigan belgidan kam sahifa skan sifatida qaraladi va tanib olinadi; boshqa sahifalar asl matnlarini saqlab qoladi.

20+ tilla

Lotin yozuvli tilllar, soddalashtirilgan va an'anaviy xitoycha, yaponcha sozlashsiz. Koreyscha, kirill, arab, xindi, tailand va grek skanlar tili ishorasi bilan ishlaydi.

Aralash hujjatlar qo'llab-quvvatlanadi

Imzo sahifasi skanerlangan shartnomalar, skanerlangan rasmlar kiritilgan hisobotlar — matn sahifa tartibida qaytadi, tanib olingan sahifalar o'rnatiladi.

Serverimizdan hech narsa chiqmaydi

Sahifalar ParseJet'ning o'z infrastukturasida ochiq manbali modellar bilan tahlil qilinadi; uchinchi tomon AI xizmati hujjatni ko'rmaydi.

Markdown yoki oddiy matn

output_format=markdown so'rash uchun raqamli sahifalardan sarlavhalar va jadvallarni saqlab qolish, yoki raw oddiy matn uchun.

Bitta so'rovda 30 gacha skanerlangan sahifa

Aksariyat xatlar, shakllar va hisobotlar uchun yetarli. Uzunroq skanlar: faylni bo'ling yoki API orqali partiyalarga qayta ishlang.

Foydalanish holatlari

Ushbu vositangiz vaqtni tejaydigan umumiy holatlar.

Arxivlangan shartnomalar va hisob-fakturalar

Yillar oqibati skanerlangan qog'oz ishlarini qidirish mumkin qilish — matnni bir martta olib, indekslang.

Telefonda skanerlangan hujjatlar

Skanerlash ilovasi rasmga asoslangan PDF'lar saqlaydi. Manzil, shart yoki summasini nusxalash uchun OCR orqali qayta ishlang.

Qadimgi kitoblar va hisobotlar

Skanerlangan sahifalarni iqtibos, tarjima yoki kirish imkoniyati vositalari uchun matnga aylantiring.

Skanlarni AI'ga yuborish

Claude va ChatGPT sahifa fotosini ishonchli o'qya olmaydi. Birinchi OCR, keyin joylashtirib yoki matnni o'tkazing.

API bilan avtomatlashtiring

Xuddi shu vositaning dasturiy ta'minotidan foydalaning. Har qanday til bilan ishlaydi — faqat HTTP.

cURL
# Scanned pages are detected and OCR'd automatically
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...)
curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F "[email protected]"

# Response metadata tells you which pages were recognized:
# "metadata": { "ocr_pages": [1, 2, 3], ... }
Python
import httpx

resp = httpx.post(
    "https://api.parsejet.com/v1/parse/auto/file",
    headers={"Authorization": "Bearer YOUR_API_KEY"},
    files={"file": open("scan.pdf", "rb")},
    params={"output_format": "markdown"},
    timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", []))
JavaScript
const formData = new FormData();
formData.append("file", pdfFile);

const res = await fetch(
  "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
  { method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []);

Buni avtomatlashtirmoqchimisiz?

ParseJet API sizga bitta HTTP endpoint orqali bir xil tahlil qilish quvvatini beradi. Ffmpeg yo'q, poppler yo'q, tesseract yo'q — faqat bitta API chaqiruvi.

curl -X POST https://api.parsejet.com/v1/parse/auto/url \ -H "Content-Type: application/json" \ -d '{"url":"https://example.com"}'
API Hujjatlarini O'qing

Tez-tez so'raladigan savollar

PDF'ni qanday OCR qilaman?

PDF'ni yuqorida yuklang. ParseJet har bir sahifani tekshiradi, faqat rasmga asoslangan bo'lganlari tanib olinadi va sizga to'liq matnni ko'rsatadi — odatda xat yoki shakl uchun bir necha soniya ichida. Nusxalang yoki yuzlab fayllar uchun API'sini chaqiring.

PDF'imning OCR talab qilishini qanday bilaman?

Ochib, so'z tanlashga urinib ko'ring. Hech narsa belgilanmasa yoki zumning harflari fotosurat kabi pikselatsiyalashsa, sahifa rasm va OCR talab qiladi. Skanerlar, faks mashinalar va telefon skanerlash ilovalaridan chiqadigan PDF'lar deyarli har doim shunaqa bo'ladi.

Qayta PDF fayl olamanmi?

Siz matnni olasiz, yangi PDF faylni emas. Bu nusxalash, qidirish, indekslash, tarjima yoki AI modeli yuboring uchun kerak. Agar siz asl PDF'ni ko'rinmas matn qatlami qo'shilgan holda kerak bo'lsa, OCRmyPDF kabi kompyuter vositasi buning uchun ishlaydi.

Sahifa chegarasi bormi?

Bitta so'rovda 30 gacha skanerlangan sahifa tanib olinadi; allaqachon matn o'z ichiga olgan sahifalar sanalanmaydi. Uzun skanlar uchun faylni bo'ling yoki API orqali qismlarda yuboring. Javob metama'lumotlari tanib olingan sahifalarni va o'tkazilib qolganlarni ro'yxatda ko'rsatadi.

Qaysi tilllar qo'llab-quvvatlanadi?

Inglizcha va lotin yozuvli barcosmos, soddalashtirilgan va an'anaviy xitoycha, yaponcha sozlashsiz. Koreyscha, ruscha va boshqa kirill, arab, xindi, tailand yoki grek uchun language=ko, ru, ar, hi, th, el yuboring (ushbu sahifaning lokallashtirilgan versiyalari buning uchun sozlaydi).

Bepulmi?

Ha. Kuniga 3 ta bepul konvertatsiya, ro'yxatdan o'tish talab qilinmaydi. Oylik 300 kredit bilan bepul hisob. Pullik rejalar kattaroq fayllar va yuqori kvotalar uchun oyiga $19 dan.

Matnni bepul ajratishni boshlang

Ro'yxatdan o'tish talab etilmaydi. Birinchi faylingizni soniyalar ichida tahlil qiling.

Narxlarni Ko'rish