ParseJet

كيف تستخرج الجداول من ملف PDF

انسخ جدولًا من ملف PDF والصقه في Excel، وستحصل غالبًا على عمود طويل واحد من القيم المختلطة — أو على لا شيء إطلاقًا. الخطأ ليس خطأك: ملفات PDF لا تخزّن الجداول أصلًا. يقارن هذا الدليل الطرق الأربع التي تنجح فعلًا، من حيل النسخ واللصق السريعة إلى الأدوات التي تتعامل مع المستندات الممسوحة ضوئيًا، لتختار الطريقة المناسبة لملفك.

لماذا يصعب استخراج الجداول من PDF إلى هذا الحد؟

لا يعرف ملف PDF مفهوم الجدول. ما يبدو صفوفًا وأعمدة ليس سوى شذرات نصية منفردة موضوعة عند إحداثيات x/y، مع خطوط مرسومة بينها أحيانًا. الجدول موجود في عينيك فقط — فالملف لا يخزّن خلايا ولا صفوفًا ولا صف عناوين.

كل طريقة استخراج هي إذن إعادة بناء: خوارزمية تخمّن أي الشذرات النصية تنتمي إلى الخلية نفسها، وأي الخلايا تشكّل صفًا، وأين تبدأ الأعمدة. الجداول المسطّرة (ذات خطوط الشبكة الظاهرة) أسهل في إعادة البناء؛ أما الجداول المفصولة بالمسافات البيضاء والخلايا المدمجة والخلايا متعددة الأسطر والجداول الممتدة على صفحات فهي حيث تفشل معظم الأدوات.

وتضيف ملفات PDF الممسوحة ضوئيًا طبقة أخرى: الصفحة صورة فوتوغرافية، فلا نص فيها أصلًا حتى يعمل OCR. اختر طريقتك بناءً على أي هذه المشكلات موجودة في مستندك.

الطريقة 1: النسخ واللصق في Excel (سريعة، للجداول المسطّرة الصغيرة)

مع جدول بسيط جيد التسطير، حدّده في عارض PDF وانسخه والصقه في Excel أو Google Sheets. إن هبط كل شيء في عمود واحد، استخدم Data ← Text to Columns في Excel أو Data ← Split text to columns في Sheets لإعادة تقسيم القيم.

حيلة مفيدة: الصق في محرر نصوص عادي أولًا لترى أي بنية نجت. إن كانت القيم مفصولة بمسافات أو علامات جدولة متسقة، فسيستعيد Text to Columns الجدول؛ أما إن كانت الصفوف متداخلة أو مبتورة، فلن يصلحها أي قدر من التقسيم.

متى تنجح: الجداول المسطّرة في صفحة واحدة بقيم خلايا قصيرة. ومتى تفشل: الخلايا المدمجة، والنصوص متعددة الأسطر داخل الخلايا، والأرقام ذات فواصل الآلاف التي تتشظى، وأي مستند ممسوح ضوئيًا.

الطريقة 2: Power Query في Excel أو Word (مدمجة، بلا أدوات إضافية)

يستطيع Excel الحديث استيراد جداول PDF مباشرة: Data ← Get Data ← From File ← From PDF. يفحص Excel المستند ويعرض كل جدول يكتشفه مع معاينة — اختر الجدول وانقر Load ليهبط كنطاق جدول بيانات حقيقي. هذا أفضل خيار مدمج على Windows (يتطلب ترخيص Microsoft 365 أو 2021 وما بعده، وليس متاحًا في Excel للـ Mac في كل الإصدارات).

ويستطيع Word أيضًا فتح ملفات PDF مباشرة (File ← Open ← اختر ملف PDF). يحوّل المستند إلى ملف قابل للتحرير، وتنجو الجداول البسيطة عادةً كجداول Word حقيقية يمكنك نسخها إلى Excel.

متى تنجح: ملفات PDF المنشأة رقميًا ذات الجداول واضحة التسطير. ومتى تفشل: الجداول المعتمدة على المسافات فقط كثيرًا ما تُفوَّت أو تُقسَّم خطأ، والجداول الممتدة على صفحات تُستورد كشذرات منفصلة، والملفات الممسوحة ضوئيًا لا تنتج شيئًا — فـ Power Query لا يجري OCR.

الطريقة 3: مكتبات Python — camelot وtabula-py وpdfplumber (للمطورين)

إن احتجت استخراج الجداول من ملفات PDF كثيرة برمجيًا، فالخيارات مفتوحة المصدر الراسخة هي camelot (الأفضل مع الجداول المسطّرة، بوضعي اكتشاف)، وtabula-py (غلاف حول محرك Tabula بلغة Java، متين مع التخطيطات المتسقة)، وpdfplumber (تحكم منخفض المستوى بالكلمات والخطوط والمستطيلات — الأفضل حين تحتاج منطقًا مخصصًا).

مثال camelot بسيط: pip install camelot-py[cv]، ثم tables = camelot.read_pdf("report.pdf", pages="all")، وتعطيك tables[0].df إطار بيانات pandas. صدّر بـ .to_csv() أو .to_excel().

العقبة: لكل مكتبة نمط تخطيط تفضّله، والمستندات الواقعية تخلط الأنماط. توقّع ضبط الإعدادات لكل عائلة مستندات (flavor="stream" مقابل "lattice" في camelot، وتلميحات المناطق في tabula)، ولا تتعامل أي منها مع ملفات PDF الممسوحة ضوئيًا — ستحتاج لتشغيل OCR أولًا وستخسر التخطيط في الطريق.

لنظرة أوسع على تحليل PDF في Python فيما يتجاوز الجداول، راجع دليلنا حول تحويل PDF إلى Markdown في Python.

الطريقة 4: الاستخراج بالذكاء الاصطناعي (الملفات الممسوحة، والتخطيطات المختلطة، والحجم الكبير)

تعتمد المقاربة الأحدث على نماذج فهم المستندات التي تقرأ الصفحة كما يقرؤها الإنسان — فتكتشف بنية الجدول من التخطيط البصري بدل الاعتماد على خطوط التسطير أو استدلالات الإحداثيات. هذه هي الفئة الوحيدة من الطرق التي تتعامل مع المستندات الممسوحة ضوئيًا والصفحات المصوّرة والتخطيطات غير المتسقة في تمريرة واحدة.

يعمل ParseJet بهذه الطريقة: ارفع ملف PDF على parsejet.com/tools/pdf-to-markdown وتعود الجداول كجداول Markdown نظيفة بترتيب القراءة — وتُعالَج الصفحات الممسوحة ضوئيًا عبر OCR تلقائيًا. وإن أردت بيانات بدل نص، تعيد واجهة API المستند المحلَّل كمخرجات منظّمة (انظر أداة تحويل PDF إلى JSON)، وطلب POST واحد لكل ملف يجعلها عملية لخطوط المعالجة الدفعية.

متى تنجح: المستندات الممسوحة والمصوّرة، والتخطيطات المختلطة بين المسطّر والمفصول بالمسافات، والمعالجة الدفعية حيث يستحيل الضبط لكل مستند. والمقايضة: إنها خدمة مستضافة — فلجدول واحد لمرة واحدة في ملف PDF نظيف، الطريقة 1 أو 2 أسرع.

أي طريقة تختار؟

جدول مسطّر صغير واحد، لمرة واحدة: النسخ واللصق (الطريقة 1)، مع اللجوء إلى Power Query في Excel (الطريقة 2) إن اختلط اللصق.

تقارير متكررة بالتخطيط نفسه: Power Query لمستخدمي جداول البيانات، وcamelot أو tabula-py (الطريقة 3) للمطورين — إعداد لمرة واحدة يؤتي ثماره مع كل ملف قادم.

مستندات ممسوحة ضوئيًا أو صور أو تخطيطات مختلطة فوضوية: الاستخراج بالذكاء الاصطناعي (الطريقة 4) هو واقعيًا الخيار الوحيد الذي لا يتضمن إعادة الكتابة يدويًا.

مئات المستندات بتخطيطات متفاوتة: الطريقة 4 عبر API — فضبط مكتبات الطريقة 3 لكل مستند لا يتوسع لأكثر من حفنة من عائلات التخطيطات.

استخرج الجداول من أي ملف PDF — حتى الممسوح ضوئيًا

ارفع ملف PDF واحصل على كل جدول كـ Markdown نظيف بترتيب القراءة، مع معالجة الصفحات الممسوحة ضوئيًا عبر OCR تلقائيًا. جرّب مجانًا وبلا تسجيل.

جرّب تحويل PDF إلى Markdown

الأسئلة الشائعة

كيف أستخرج جدولًا من PDF إلى Excel؟

جرّب مستورد Excel المدمج أولًا: Data ← Get Data ← From File ← From PDF، ثم اختر الجدول المكتشف. إن فوّته Excel أو شوّهه — وهذا شائع مع الجداول المفصولة بالمسافات أو الممسوحة ضوئيًا — فاستخرجه بأداة ذكاء اصطناعي مثل ParseJet والصق جدول Markdown في Excel.

هل يمكنني استخراج الجداول من ملف PDF ممسوح ضوئيًا؟

فقط بالأدوات القادرة على OCR. النسخ واللصق وPower Query ومكتبات Python للجداول كلها تتطلب نصًا حقيقيًا. أما المستخرجات المدعومة بالذكاء الاصطناعي فتجري OCR على الصفحة أولًا ثم تعيد بناء الجدول — ارفع المسح إلى ParseJet ويعود الجدول نصًا.

ما أفضل مكتبة Python لاستخراج الجداول من PDF؟

camelot للجداول المسطّرة، وtabula-py لتخطيطات التقارير المتسقة، وpdfplumber حين تحتاج منطقًا مخصصًا منخفض المستوى. الثلاث تحتاج ضبطًا لكل تخطيط ولا تتعامل أي منها مع الصفحات الممسوحة ضوئيًا، لذا تنتهي الخطوط ذات المدخلات الفوضوية عادةً باستدعاء API للتحليل بدلًا منها.

لماذا ينتهي الجدول الملصوق في عمود واحد؟

لأن عارض PDF لديك سلسل شذرات صفوف الجدول كأسطر عادية مفصولة بمسافات، فلصق Excel كل سطر في خلية واحدة. استخدم Text to Columns لإعادة التقسيم، أو استخدم طريقة تعيد بناء بنية الجدول (Power Query أو أداة استخراج).

كيف تُستخرج الجداول ذات الخلايا المدمجة؟

بشكل سيئ في معظم الأدوات — فالخلايا المدمجة تكسر شبكة الصفوف والأعمدة التي تعتمد عليها كل الاستدلالات. الاستخراج الواعي بالبنية يتعامل معها أفضل؛ وتوقّع مراجعة المناطق المدمجة يدويًا أيًا كانت الطريقة.

هل يمكنني استخراج الجداول من ملفات PDF كثيرة تلقائيًا؟

نعم — أرسل كل ملف بطلب POST إلى API للتحليل. مع ParseJet، تعيد /v1/parse/auto/file المستند والجداول فيه كـ Markdown (أو JSON منظّم)، ويشمل حساب API المجاني 300 رصيد شهريًا.

ابدأ استخراج النص مجانًا

لا حاجة للتسجيل. قم بتحليل ملفك الأول في ثوانٍ.

عرض الأسعار