PDF OCR — استخراج النص من ملفات PDF الممسوحة
ملف PDF الممسوح ضوئيًا هو مجرد صور صفحات: لا يمكنك البحث فيه أو تحديد النص أو النسخ منه. يرسّم PDF OCR من ParseJet كل صفحة صورة فقط، يشغّل استخراج النص على خوادمه الخاصة، ويعيد المستند كنص يمكنك البحث عنه والنسخ والاستفادة منه. الصفحات التي لديها بالفعل طبقة نص تُستخرج كما هي، لذا المستندات المختلطة تخرج كاملة.
أسقط ملفًا هنا أو تصفح
يقبل ملفات PDF
مجاني — 3 طلبات/يوم، بدون تسجيل. للحصول على 300 رصيد/شهر مجانًا.
كيف يعمل
حمّل ملف PDF الممسوح ضوئيًا
اسحب الملف أعلاه — من ماسح ضوئي أو تطبيق ماسح على الهاتف أو فاكس. ملفات PDF الرقمية بطبقة نص تعمل أيضًا.
استخراج النص، صفحة تلو الأخرى
يفحص ParseJet كل صفحة. الصفحات بنص حقيقي تُقرأ مباشرة؛ صفحات الصور فقط تُرسّم وتمر عبر OCR.
انسخ النص
انسخ المستند كاملاً أو احصل عليه كـ Markdown أو نص عادي عبر API لتغذية البحث والجداول أو نموذج LLM.
الميزات الرئيسية
ما الذي يجعل pdf ocr هذا مميزًا.
يكتشف أي صفحات تحتاج OCR
لا حاجة للإعدادات. صفحة تحتوي على أقل من عشرين حرفًا قابل للاستخراج تُعامل كمسح وتُعترف بها؛ كل صفحة أخرى تحافظ على نصها الأصلي.
20+ لغة
اللغات اللاتينية والصينية المبسطة والتقليدية واليابانية لا تحتاج إعدادات. تعمل مسوحات الكورية والسيريلية والعربية والهندية والتايلاندية واليونانية مع تلميح لغة.
معالجة المستندات المختلطة
عقود بصفحة توقيع ممسوحة ضوئيًا أو تقارير بمسوحات مدرجة — يخرج النص بترتيب الصفحات مع الصفحات المعترف بها مدرجة.
لا يترك خوادمنا
تُرسّم الصفحات وتُعترف بها على بنية ParseJet الخاصة بنماذج مفتوحة المصدر؛ لا ترى أي خدمة ذكاء اصطناعي من طرف ثالث مستندك.
Markdown أو نص عادي
اطلب output_format=markdown للحفاظ على العناوين والجداول من الصفحات الرقمية، أو raw للنص العادي.
حتى 30 صفحة ممسوحة ضوئيًا في الطلب الواحد
كافٍ لمعظم الخطابات والنماذج والتقارير. مسوحات أطول: قسّم الملف أو معالجتها على دفعات عبر API.
حالات الاستخدام
سيناريوهات شائعة حيث يوفر لك هذا الأداة الوقت.
العقود والفواتير المؤرشفة
اجعل سنوات الأعمال الورقية الممسوحة قابلة للبحث — استخرج النص مرة واحدة والفهرسة.
المستندات الممسوحة بالهاتف
تطبيقات الماسح توفر ملفات PDF صور فقط. شغّلها عبر OCR لنسخ عنوان أو بند أو إجمالي.
الكتب والتقارير القديمة
حوّل الصفحات الممسوحة إلى نص للاقتباس أو الترجمة أو أدوات سهولة الوصول.
تغذية المسوحات للذكاء الاصطناعي
Claude وChatGPT لا يستطيعان قراءة صورة صفحة بشكل موثوق. استخرج النص أولاً، ثم الصق أو ضخّ البيانات.
أتمتة باستخدام الـ API
استخدم نفس الأداة برمجيًا. يعمل مع أي لغة — مجرد HTTP.
# Scanned pages are detected and OCR'd automatically curl -X POST "https://api.parsejet.com/v1/parse/auto/file?output_format=markdown" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Non-Latin scripts: add a language hint (ko, ru, ar, hi, th, el ...) curl -X POST "https://api.parsejet.com/v1/parse/auto/file?language=ru" \ -H "Authorization: Bearer YOUR_API_KEY" \ -F "[email protected]" # Response metadata tells you which pages were recognized: # "metadata": { "ocr_pages": [1, 2, 3], ... }
import httpx
resp = httpx.post(
"https://api.parsejet.com/v1/parse/auto/file",
headers={"Authorization": "Bearer YOUR_API_KEY"},
files={"file": open("scan.pdf", "rb")},
params={"output_format": "markdown"},
timeout=120,
)
data = resp.json()
print(data["text"])
print("OCR'd pages:", data["metadata"].get("ocr_pages", [])) const formData = new FormData();
formData.append("file", pdfFile);
const res = await fetch(
"https://api.parsejet.com/v1/parse/auto/file?output_format=markdown",
{ method: "POST", headers: { Authorization: "Bearer YOUR_API_KEY" }, body: formData },
);
const { text, metadata } = await res.json();
console.log(text);
console.log("OCR'd pages:", metadata.ocr_pages ?? []); هل تريد أتمتة هذا؟
ParseJet API تمنحك نفس قوة التحليل عبر نقطة نهاية HTTP واحدة. لا ffmpeg، لا poppler، لا tesseract — مجرد استدعاء API واحد.
الأسئلة الشائعة
كيف أشغّل OCR على ملف PDF؟
حمّل ملف PDF أعلاه. ينظر ParseJet إلى كل صفحة، يعترف بالصفحات التي هي صور فقط، ويعرضك النص الكامل — عادةً خلال ثوانٍ لخطاب أو نموذج نموذجي. انسخه، أو استدعِ API لفعل الشيء نفسه لملفات كثيرة.
كيف أعرف إذا كان ملف PDF بحاجة إلى OCR؟
افتحه وحاول تحديد كلمة. إذا لم يحدث تسليط ضوء، أو التكبير يجعل الأحرف تبدو متبقعة مثل صورة، فالصفحة صورة وتحتاج OCR. ملفات PDF من الماسحات الضوئية وآلات الفاكس وتطبيقات الماسح على الهاتف تكون مثل هذا دائمًا.
هل أحصل على ملف PDF قابل للبحث مرة أخرى؟
تحصل على النص، وليس ملف PDF جديد. هذا ما تحتاجه للنسخ والبحث والفهرسة والترجمة أو تغذية نموذج ذكاء اصطناعي. إذا كنت بحاجة تحديدًا لملف PDF الأصلي مع طبقة نص غير مرئية مضافة، فأداة سطح مكتب مثل OCRmyPDF تفعل هذا.
هل هناك حد للصفحات؟
حتى 30 صفحة ممسوحة ضوئيًا تُعترف بها في الطلب الواحد؛ الصفحات التي تحتوي بالفعل على نص لا تُحسب. للمسوحات الأطول، قسّم الملف أو أرسله على دفعات عبر API. تسرد البيانات الوصفية للاستجابة الصفحات التي تمت معالجتها والصفحات المخطوفة.
أي اللغات مدعومة؟
الإنجليزية وجميع اللغات اللاتينية والصينية المبسطة والتقليدية واليابانية تعمل تلقائيًا. للكورية والروسية واللغات السيريلية الأخرى والعربية والهندية والتايلاندية أو اليونانية، اطلب language=ko أو ru أو ar أو hi أو th أو el (النسخ المترجمة من هذه الصفحة تفعل ذلك لك).
هل هي مجانية؟
نعم. ثلاث تحويلات مجانية يوميًا بدون تسجيل، 300 رصيد شهريًا مع حساب مجاني، وخطط مدفوعة من 19 دولار شهريًا لملفات أكبر وحصص أعلى.
أدوات ذات صلة
Image to Text — Free OCR (Optical Character Recognition)
Convert image to text online for free. OCR reads JPG, PNG, WebP and photos in 20+ languages and returns copy-ready text — no signup. API for developers too.
PDF to Text Converter
Convert PDF to text online for free. This PDF text converter handles multi-page files, scanned PDFs (OCR), and complex layouts. No signup — or automate via API.
Extract Text from PDF
Extract text from any PDF in seconds — digital or scanned. Drop the file, copy the text. Free, no signup, nothing to install; developers get the same via API.
PDF to Markdown Converter
Convert PDF to Markdown online for free. Preserves headings, lists, tables, and code blocks. No signup required — try it instantly or automate via API.