PDF-dan jadvalni qanday ajratish mumkin
PDF-dagi jadvalni nusxalab Excel-ga qo‘ysangiz, odatda aralashib ketgan qiymatlardan iborat bitta uzun ustun olasiz — yoki umuman hech narsa. Bu sizning aybingiz emas: PDF-lar aslida jadval saqlamaydi. Ushbu qo‘llanma ishlaydigan 4 usulni — tezkor copy-paste hiylalaridan skanerlangan hujjatlarni uddalaydigan vositalargacha — taqqoslaydi, faylingizga mosini tanlashingiz uchun.
Nega PDF jadvallarini ajratish shunchalik qiyin
PDF-da jadval tushunchasining o‘zi yo‘q. Qator va ustun bo‘lib ko‘ringan narsa aslida x/y koordinatalarda joylashtirilgan alohida matn parchalari, ba’zan ular orasida chizilgan chiziqlar bilan. "Jadval" faqat sizning ko‘zingizda mavjud — fayl na katak, na qator, na sarlavha saqlaydi.
Shu sababli har qanday ajratish usuli — bu qayta tiklash: algoritm qaysi matn parchalari bitta katakka tegishli ekanini, qaysi kataklar qator hosil qilishini va ustunlar qayerdan boshlanishini taxmin qiladi. Chiziqli jadvallar (ko‘rinadigan to‘r chiziqlari bilan) osonroq tiklanadi; bo‘sh joy bilan ajratilgan jadvallar, birlashtirilgan kataklar, ko‘p qatorli kataklar va ko‘p sahifali jadvallar — aksariyat vositalar aynan shu yerda yiqiladi.
Skanerlangan PDF-lar yana bir qatlam qo‘shadi: sahifa — bu fotosurat, shuning uchun OCR ishga tushmaguncha matnning o‘zi umuman yo‘q. Usulni hujjatingizda ushbu muammolardan qaysi biri borligiga qarab tanlang.
1-usul: Excel-ga copy-paste (tezkor, kichik chiziqli jadvallar)
Oddiy, aniq chiziqli jadval uchun uni PDF ko‘rish dasturida belgilang, nusxalang va Excel yoki Google Sheets-ga qo‘ying. Hammasi bitta ustunga tushib qolsa, qiymatlarni qayta bo‘lish uchun Data → Text to Columns (Excel) yoki Data → Split text to columns (Sheets) dan foydalaning.
Foydali variatsiya: qaysi tuzilma saqlanib qolganini ko‘rish uchun avval oddiy matn muharririga qo‘ying. Qiymatlar izchil bo‘sh joy yoki tab bilan ajratilgan bo‘lsa, Text to Columns jadvalni tiklaydi; qatorlar aralashib yoki kesilib ketgan bo‘lsa, hech qanday bo‘lish buni tuzata olmaydi.
Qachon ishlaydi: qisqa katak qiymatli bir sahifali chiziqli jadvallar. Qachon ishlamaydi: birlashtirilgan kataklar, kataklar ichidagi ko‘p qatorli matn, minglik ajratuvchili raqamlarning bo‘linib ketishi va har qanday skanerlangan hujjat.
2-usul: Excel Power Query yoki Word (o‘rnatilgan, qo‘shimcha vositasiz)
Zamonaviy Excel PDF jadvallarini to‘g‘ridan-to‘g‘ri import qila oladi: Data → Get Data → From File → From PDF. Excel hujjatni skanerlaydi, topgan har bir jadvalni ro‘yxatlaydi va oldindan ko‘rsatadi — jadvalni tanlang, Load bosing va u to‘laqonli jadval diapazoni sifatida tushadi. Bu Windows-dagi eng yaxshi o‘rnatilgan variant (Microsoft 365 yoki 2021+ litsenziyasi talab qilinadi va Excel for Mac-ning hamma versiyalarida mavjud emas).
Word ham PDF-larni to‘g‘ridan-to‘g‘ri ocha oladi (File → Open → PDF-ni tanlang). U hujjatni tahrirlanadigan faylga o‘giradi va oddiy jadvallar odatda Excel-ga nusxalash mumkin bo‘lgan haqiqiy Word jadvallari sifatida saqlanib qoladi.
Qachon ishlaydi: aniq chiziqli jadvalli, raqamli yaratilgan PDF-lar. Qachon ishlamaydi: faqat bo‘sh joy bilan ajratilgan jadvallar tez-tez o‘tkazib yuboriladi yoki noto‘g‘ri bo‘linadi, ko‘p sahifali jadvallar alohida bo‘laklar sifatida import bo‘ladi, skanerlangan PDF-lar esa hech narsa bermaydi — Power Query OCR qilmaydi.
3-usul: Python kutubxonalari — camelot, tabula-py, pdfplumber (dasturchilar)
Ko‘plab PDF-lardan jadvallarni dasturiy ajratish kerak bo‘lsa, o‘zini ko‘rsatgan ochiq kodli variantlar: camelot (chiziqli jadvallarda eng yaxshi, ikkita aniqlash rejimi), tabula-py (Java-dagi Tabula dvigateli ustidan wrapper, izchil maketlarda ishonchli) va pdfplumber (so‘zlar, chiziqlar va to‘rtburchaklar ustidan past darajali nazorat — maxsus mantiq kerak bo‘lganda eng yaxshisi).
Minimal camelot misoli: pip install camelot-py[cv], keyin tables = camelot.read_pdf("report.pdf", pages="all") va tables[0].df sizga pandas DataFrame beradi. .to_csv() yoki .to_excel() bilan eksport qiling.
Muammo shundaki, har bir kutubxonaning o‘zi yoqtiradigan maket uslubi bor, real hujjatlar esa uslublarni aralashtiradi. Har bir hujjat oilasi uchun sozlamalarni moslashga tayyor turing (camelot-da flavor="stream" yoki "lattice", tabula-da area ko‘rsatmalari), va ularning birortasi skanerlangan PDF-larni uddalay olmaydi — avval OCR ishga tushirishga to‘g‘ri keladi va bu jarayonda maket yo‘qoladi.
Python-da jadvallardan tashqari PDF parsing haqida kengroq ma’lumot uchun Python-da PDF-ni Markdown-ga o‘girish bo‘yicha qo‘llanmamizga qarang.
4-usul: AI asosidagi ajratish (skanerlangan PDF-lar, aralash maketlar, masshtab)
Eng yangi yondashuv sahifani inson kabi o‘qiydigan hujjatni tushunish modellaridan foydalanadi — jadval tuzilmasi chiziqlar yoki koordinata evristikasiga tayanmasdan, vizual maketdan aniqlanadi. Bu skanerlangan hujjatlar, suratga olingan sahifalar va nomuvofiq maketlarni bitta o‘tishda uddalaydigan yagona usul sinfi.
ParseJet aynan shunday ishlaydi: parsejet.com/tools/pdf-to-markdown sahifasiga PDF yuklang — jadvallar o‘qish tartibida toza Markdown jadvallari sifatida qaytadi, skanerlangan sahifalarga OCR avtomatik qo‘llanadi. Matn emas, ma’lumot kerak bo‘lsa, API parse qilingan hujjatni tuzilgan natija sifatida qaytaradi (PDF to JSON vositasiga qarang), har fayl uchun bitta POST so‘rovi esa uni ommaviy pipeline-lar uchun amaliy qiladi.
Qachon ishlaydi: skanerlangan va suratga olingan hujjatlar, aralash chiziqli/bo‘sh joyli maketlar hamda har hujjatni alohida sozlash imkonsiz bo‘lgan ommaviy ishlov. Kamchiligi: bu hosted xizmat — toza PDF-dagi bitta jadval uchun 1- yoki 2-usul tezroq.
Qaysi usulni tanlash kerak?
Bitta kichik chiziqli jadval, bir marta: copy-paste (1-usul); qo‘yish aralashib ketsa, Excel Power Query (2-usul)ga o‘ting.
Bir xil maketli takrorlanuvchi hisobotlar: jadval bilan ishlaydiganlar uchun Power Query, dasturchilar uchun camelot yoki tabula-py (3-usul) — bir martalik sozlash har bir keyingi faylda o‘zini oqlaydi.
Skanerlangan hujjatlar, suratlar yoki tartibsiz aralash maketlar: AI ajratish (4-usul) — qo‘lda qayta terishni talab qilmaydigan realistik yagona variant.
Turli maketli yuzlab hujjatlar: API orqali 4-usul — 3-usul kutubxonalarini har hujjat uchun sozlash bir nechta maket oilasidan nariga masshtablanmaydi.
Istalgan PDF-dan jadvallarni ajrating — skanerlar ham
PDF yuklang va har bir jadvalni o‘qish tartibida toza Markdown sifatida oling — skanerlangan sahifalarga OCR avtomatik qo‘llanadi. Bepul sinab ko‘ring, ro‘yxatdan o‘tish shart emas.
PDF to Markdown-ni sinab ko‘ringTez-tez so'raladigan savollar
PDF-dan jadvalni Excel-ga qanday ajrataman?
Avval Excel-ning o‘rnatilgan importini sinang: Data → Get Data → From File → From PDF, so‘ng topilgan jadvalni tanlang. Excel uni o‘tkazib yuborsa yoki buzib qo‘ysa — bo‘sh joyli yoki skanerlangan jadvallarda tez-tez uchraydi — ParseJet kabi AI vosita bilan ajratib, Markdown jadvalini Excel-ga qo‘ying.
Skanerlangan PDF-dan jadval ajrata olamanmi?
Faqat OCR imkoniyatli vositalar bilan. Copy-paste, Power Query va Python jadval kutubxonalarining barchasi haqiqiy matn talab qiladi. AI asosidagi ajratgichlar avval sahifaga OCR qo‘llaydi, keyin jadvalni qayta tiklaydi — skanni ParseJet-ga yuklang va jadval matn sifatida qaytadi.
PDF jadvallarini ajratish uchun eng yaxshi Python kutubxonasi qaysi?
Chiziqli jadvallar uchun camelot, izchil hisobot maketlari uchun tabula-py, maxsus past darajali mantiq kerak bo‘lsa — pdfplumber. Uchchalasi ham har maket uchun sozlashni talab qiladi va birortasi skanerlangan sahifalarni uddalamaydi, shuning uchun tartibsiz kirishli pipeline-lar odatda parsing API-ni chaqirishga o‘tadi.
Nega qo‘yilgan jadvalim bitta ustunga tushib qoladi?
PDF ko‘rish dasturingiz jadval qatorlarining parchalarini bo‘sh joyli oddiy qatorlar sifatida seriyalashtirgan, Excel esa har qatorni bitta katakka qo‘ygan. Qayta bo‘lish uchun Text to Columns dan foydalaning yoki jadval tuzilmasini qayta tiklaydigan usulni (Power Query yoki ajratish vositasi) qo‘llang.
Birlashtirilgan katakli jadvallar qanday ajraladi?
Aksariyat vositalarda — yomon: birlashtirilgan kataklar har qanday evristika tayanadigan qator/ustun to‘rini buzadi. Tuzilmani tushunadigan ajratish ularni eng yaxshi uddalaydi; qaysi usulni tanlamang, birlashtirilgan joylarni qo‘lda tekshirishga tayyor bo‘ling.
Ko‘plab PDF-lardan jadvallarni avtomatik ajrata olamanmi?
Ha — har faylni parsing API-ga POST qiling. ParseJet-da /v1/parse/auto/file hujjatni jadvallari Markdown (yoki tuzilgan JSON) ko‘rinishida qaytaradi, bepul API hisobiga esa oyiga 300 kredit kiradi.
Bog'liq vositalar
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.
PDF to JSON Converter
Convert PDF to JSON online for free. Get text, title, and metadata as structured JSON — ready for your app, database, or AI pipeline. API included.
Extract Text from PDF
Extract text from PDF files online for free. Supports scanned documents, multi-page PDFs, and complex layouts. No installation needed — works in your browser.
Related guides
How to Convert PDF to Markdown in Python
Convert PDF to Markdown in Python: PyMuPDF4LLM, Marker, MarkItDown, and a hosted API compared — with working code, accuracy notes, and when to pick each.
How to Copy Text from a PDF
Learn 4 proven ways to copy text from any PDF file — regular, scanned, or protected. Includes free methods, step-by-step instructions, and troubleshooting tips.
Matnni bepul ajratishni boshlang
Ro'yxatdan o'tish talab etilmaydi. Birinchi faylingizni soniyalar ichida tahlil qiling.