PDF OCR — skanerlangan PDF-lardan matn tanib olish
Skanerlangan PDF — bu sahifalar rasmidek: undan matnni qidira olmaysiz, tanlaya olmaysiz, nusxala olmaysiz. ParseJet'ning PDF OCR xizmati har bir rasmga asoslangan sahifani tahlil qiladi, matn tanib olishni o'z serverlarida ishga tushiradi va hujjatni qidirish, nusxalash va qayta foydalanish mumkin bo'lgan matnga aylantiradib qaytaradi. Allaqachon matn qatlami bo'lgan sahifalar o'z holida o'qiladi, shuning uchun aralash hujjatlar butunlay tugaydi.
Faylni bu erga tashlang yoki ko‘rib chiqing
PDF fayllarni qabul qiladi
Bepul — kuniga 3 so‘rov, ro‘yxatdan o‘tish shart emas. oyiga 300 kredit bepul olish uchun.
Qanday ishlaydi
Skanerlangan PDF'ni yuklang
Faylni tashlang — skalerdan, telefon skanerlash ilovasidan yoki faksdan. Matn qatlami bo'lgan raqamli PDF'lar ham ishlaydi.
Matn tanib olish, sahifa bo'yicha
ParseJet har bir sahifani tekshiradi. Haqiqiy matnga ega sahifalar to'g'ridan-to'g'ri o'qiladi; faqat rasmlarga asoslangan sahifalar OCR orqali qayta ishlanadi.
Matnni nusxalang
Butun hujjatni nusxalang yoki API orqali Markdown yoki oddiy matn sifatida oling, qidirish, jadvallar yoki LLM'ga yuborish uchun.
Asosiy xususiyatlar
Bu pdf ocr ni nima ajralib turadigan qiladi.
Qaysi sahifalar OCR talab qilishini aniqlaydi
Sozlashga shart emas. Bitta-ikki o'nlik chiqaradigan belgidan kam sahifa skan sifatida qaraladi va tanib olinadi; boshqa sahifalar asl matnlarini saqlab qoladi.
20+ tilla
Lotin yozuvli tilllar, soddalashtirilgan va an'anaviy xitoycha, yaponcha sozlashsiz. Koreyscha, kirill, arab, xindi, tailand va grek skanlar tili ishorasi bilan ishlaydi.
Aralash hujjatlar qo'llab-quvvatlanadi
Imzo sahifasi skanerlangan shartnomalar, skanerlangan rasmlar kiritilgan hisobotlar — matn sahifa tartibida qaytadi, tanib olingan sahifalar o'rnatiladi.
Serverimizdan hech narsa chiqmaydi
Sahifalar ParseJet'ning o'z infrastukturasida ochiq manbali modellar bilan tahlil qilinadi; uchinchi tomon AI xizmati hujjatni ko'rmaydi.
Markdown yoki oddiy matn
output_format=markdown so'rash uchun raqamli sahifalardan sarlavhalar va jadvallarni saqlab qolish, yoki raw oddiy matn uchun.
Bitta so'rovda 30 gacha skanerlangan sahifa
Aksariyat xatlar, shakllar va hisobotlar uchun yetarli. Uzunroq skanlar: faylni bo'ling yoki API orqali partiyalarga qayta ishlang.
Foydalanish holatlari
Ushbu vositangiz vaqtni tejaydigan umumiy holatlar.
Arxivlangan shartnomalar va hisob-fakturalar
Yillar oqibati skanerlangan qog'oz ishlarini qidirish mumkin qilish — matnni bir martta olib, indekslang.
Telefonda skanerlangan hujjatlar
Skanerlash ilovasi rasmga asoslangan PDF'lar saqlaydi. Manzil, shart yoki summasini nusxalash uchun OCR orqali qayta ishlang.
Qadimgi kitoblar va hisobotlar
Skanerlangan sahifalarni iqtibos, tarjima yoki kirish imkoniyati vositalari uchun matnga aylantiring.
Skanlarni AI'ga yuborish
Claude va ChatGPT sahifa fotosini ishonchli o'qya olmaydi. Birinchi OCR, keyin joylashtirib yoki matnni o'tkazing.
API bilan avtomatlashtiring
Xuddi shu vositaning dasturiy ta'minotidan foydalaning. Har qanday til bilan ishlaydi — faqat HTTP.
# Scanned pages are detected and OCR'd automatically curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...) curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Response metadata tells you which pages were recognized: # "metadata": { "ocr_pages": [1, 2, 3], ... }
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("scan.pdf", "rb")},
params={"output_format": "markdown"},
timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", [])) const formData = new FormData();
formData.append("file", pdfFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
{ method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []); Buni avtomatlashtirmoqchimisiz?
ParseJet API sizga bitta HTTP endpoint orqali bir xil tahlil qilish quvvatini beradi. Ffmpeg yo'q, poppler yo'q, tesseract yo'q — faqat bitta API chaqiruvi.
Tez-tez so'raladigan savollar
PDF'ni qanday OCR qilaman?
PDF'ni yuqorida yuklang. ParseJet har bir sahifani tekshiradi, faqat rasmga asoslangan bo'lganlari tanib olinadi va sizga to'liq matnni ko'rsatadi — odatda xat yoki shakl uchun bir necha soniya ichida. Nusxalang yoki yuzlab fayllar uchun API'sini chaqiring.
PDF'imning OCR talab qilishini qanday bilaman?
Ochib, so'z tanlashga urinib ko'ring. Hech narsa belgilanmasa yoki zumning harflari fotosurat kabi pikselatsiyalashsa, sahifa rasm va OCR talab qiladi. Skanerlar, faks mashinalar va telefon skanerlash ilovalaridan chiqadigan PDF'lar deyarli har doim shunaqa bo'ladi.
Qayta PDF fayl olamanmi?
Siz matnni olasiz, yangi PDF faylni emas. Bu nusxalash, qidirish, indekslash, tarjima yoki AI modeli yuboring uchun kerak. Agar siz asl PDF'ni ko'rinmas matn qatlami qo'shilgan holda kerak bo'lsa, OCRmyPDF kabi kompyuter vositasi buning uchun ishlaydi.
Sahifa chegarasi bormi?
Bitta so'rovda 30 gacha skanerlangan sahifa tanib olinadi; allaqachon matn o'z ichiga olgan sahifalar sanalanmaydi. Uzun skanlar uchun faylni bo'ling yoki API orqali qismlarda yuboring. Javob metama'lumotlari tanib olingan sahifalarni va o'tkazilib qolganlarni ro'yxatda ko'rsatadi.
Qaysi tilllar qo'llab-quvvatlanadi?
Inglizcha va lotin yozuvli barcosmos, soddalashtirilgan va an'anaviy xitoycha, yaponcha sozlashsiz. Koreyscha, ruscha va boshqa kirill, arab, xindi, tailand yoki grek uchun language=ko, ru, ar, hi, th, el yuboring (ushbu sahifaning lokallashtirilgan versiyalari buning uchun sozlaydi).
Bepulmi?
Ha. Kuniga 3 ta bepul konvertatsiya, ro'yxatdan o'tish talab qilinmaydi. Oylik 300 kredit bilan bepul hisob. Pullik rejalar kattaroq fayllar va yuqori kvotalar uchun oyiga $19 dan.
Bog'liq vositalar
Image to Text — Free OCR (Optical Character Recognition)
Convert image to text online for free. OCR reads JPG, PNG, WebP and photos in 20+ languages and returns copy-ready text — no signup. API for developers too.
PDF to Text Converter
Convert PDF to text online for free. This PDF text converter handles multi-page files, scanned PDFs (OCR), and complex layouts. No signup — or automate via API.
Extract Text from PDF
Extract text from any PDF in seconds — digital or scanned. Drop the file, copy the text. Free, no signup, nothing to install; developers get the same via API.
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.
Matnni bepul ajratishni boshlang
Ro'yxatdan o'tish talab etilmaydi. Birinchi faylingizni soniyalar ichida tahlil qiling.