تخطي إلى المحتوى
PDFToucan الصفحة الرئيسية لـ PDF Toucan

OCR PDF عربي: اجعل الملف الممسوح قابلاً للبحث والنسخ

PDF Toucan editorial team · آخر تحديث: ٢٠ سبتمبر ٢٠٢٦ · 8 دقائق للقراءة

OCR PDF عربي: اجعل الملف الممسوح قابلاً للبحث والنسخ

استخدم OCR PDF عربي لإضافة طبقة نص إلى ملف PDF الممسوح، فتتمكن من البحث عن الكلمات ونسخها مع بقاء شكل المستند كما هو. اختر العربية كلغة للمستند، وفعّل تصحيح الميل والاتجاه عند الحاجة، ثم راجع النتيجة قبل استخدامها في البحث أو التحويل إلى Word.

ما المقصود بـ OCR PDF عربي، وماذا يغيّر في الملف؟

الملف الممسوح ضوئياً يكون غالباً مجموعة صور لصفحات ورقية داخل حاوية PDF. تبدو الكلمات واضحة للعين، لكن قارئ PDF لا يراها كنص؛ لذلك لا تنجح وظيفة البحث، وقد يؤدي النسخ إلى نتيجة فارغة أو إلى تحديد الصفحة كصورة واحدة.

تعني OCR أو التعرف الضوئي على الحروف أن الأداة تقرأ أشكال الحروف الظاهرة في صورة الصفحة وتضيف طبقة نص فوقها أو خلفها. يبقى مظهر الصفحة قريباً من الأصل، لكن تصبح الكلمات قابلة للتحديد والنسخ والبحث داخل عارض PDF.

لا يعني ذلك الحصول على تفريغ مطابق للأصل في كل الحالات. تتأثر الدقة بجودة المصدر، خاصة في الحالات الآتية:

  • الصور الباهتة أو منخفضة الدقة والنسخ المصورة عدة مرات.
  • الصفحات الملتقطة بالموبايل بزاوية أو مع ظلال قوية.
  • الخط اليدوي، والخطوط الزخرفية، والأختام فوق النص.
  • الجداول كثيرة الأعمدة والنماذج ذات الخانات الضيقة.
  • الأسماء والأرقام والتواريخ والهمزات والتاء المربوطة.

الناتج من أداة OCR هو ملف PDF قابل للبحث، وليس ملف Word تلقائياً. كذلك، إضافة طبقة النص تعدّل محتوى المستند؛ فإذا كان PDF يحمل توقيعاً رقمياً، فلن يبقى ذلك التوقيع صالحاً بعد التعرف على النص. احتفظ دائماً بالنسخة الموقعة الأصلية دون تعديل.

كيف أستخدم أداة OCR PDF عربي على الموبايل أو الكمبيوتر؟

تعمل الخطوات من متصفح الهاتف أو الجهاز اللوحي أو الكمبيوتر. لا تحتاج إلى تثبيت برنامج، ويمكنك معالجة أكثر من ملف، مع معالجة كل ملف بصورة مستقلة.

  1. افتح أداة التعرف على النص في PDF.
  2. اضغط «اختر ملفات PDF» وحدد المستند من جهازك. يمكنك أيضاً سحب ملف PDF وإفلاته في أي مكان بالصفحة، أو لصق ملف من الحافظة عندما يكون ذلك متاحاً في جهازك.
  3. ضمن Document language اختر العربية. يجب اختيار لغة واحدة على الأقل.
  4. افتح More options إذا أردت تحديد الصفحات التي ستتم قراءتها أو تطبيق تصحيحات على الصفحات.
  5. اضغط «التعرف على النص» وانتظر اكتمال العملية. قد يستغرق التعرف بضع دقائق في المستندات ذات الصفحات الكثيرة؛ اترك علامة تبويب المتصفح مفتوحة.
  6. عند ظهور رسالة نجاح التعرف، اضغط Download the searchable PDF لتنزيل النسخة القابلة للبحث.

لا يتطلب PDF Toucan إنشاء حساب، ولا يضيف علامة مائية، ولا يفرض حداً يومياً لاستخدام أدوات المتصفح. ومع ذلك، راجع الملف بعد التنزيل بدلاً من افتراض أن كل صفحة قُرئت بدقة كاملة.

أي لغة وإعداد OCR أختار للملف العربي المختلط؟

اختيار اللغة ليس خطوة شكلية؛ فهو يساعد محرك التعرف على تمييز الحروف وأنماط الكلمات الصحيحة. لملف عربي بالكامل، اختر العربية فقط. وإذا احتوى العقد أو التقرير على عناوين أو فقرات إنجليزية حقيقية، أضف الإنجليزية أيضاً.

يمكن الجمع بين ما يصل إلى خمس لغات في عملية واحدة، لكن إضافة لغات غير موجودة فعلياً تجعل المعالجة أبطأ وقد تؤدي إلى بدائل غير متوقعة لبعض الحروف. لا تضف لغة لمجرد الاحتياط.

يوضح الجدول التالي الفرق بين خيارات قراءة الصفحات:

الخيارما الذي يفعله؟متى تستخدمه؟ملاحظة مهمة
Scan pages without textيقرأ الصفحات التي لا تحتوي نصاً، ويترك الصفحات ذات النص الموجود مسبقاًالخيار المناسب غالباً، خصوصاً للملفات المختلطةموصى به ويحافظ على النص الرقمي الجيد كما هو
Recognize existing text againيزيل النص القديم ضعيف التعرف ويقرأ الصفحة من جديدعند وجود طبقة نص يمكن تحديدها لكنها مليئة بالأخطاءلا يتوفر معه تصحيح ميل الصفحات
Treat every page as an imageيحول كل صفحة إلى صورة ثم يتعرف عليها من الصفرعند وجود طبقة نص تالفة أو غير موثوقة في كامل الملفيفقد النص القابل للتحديد والروابط الموجودة مسبقاً

ابدأ عادة بخيار Scan pages without text. فهو أسرع، ولا يعيد معالجة النص الرقمي السليم، ومع الملف الممسوح بالكامل سيقرأ كل الصفحات تلقائياً. استخدم الخيارين الآخرين فقط عندما تكون لديك علامة واضحة على أن طبقة النص القديمة غير صالحة، مثل فشل البحث عن كلمة ظاهرة بوضوح أو ظهور حروف غير مفهومة عند النسخ.

كيف أصلح ميل الصفحة أو اتجاهها قبل التعرف؟

قد تؤدي صفحة مائلة بدرجات قليلة إلى ضعف قراءة السطور العربية، وقد تجعل الصفحة المقلوبة أو الجانبية التعرف أقل موثوقية. توفر الأداة تصحيحين مفيدين ضمن إعدادات الصفحات.

  1. فعّل Straighten tilted pages إذا كانت الصفحات مصوّرة بميل بسيط. هذا التصحيح يحاذي السطور أفقياً ويساعد على تحسين القراءة.
  2. فعّل Fix page orientation automatically إذا كانت بعض الصفحات مقلوبة رأساً على عقب أو مدارة جانبياً، وهو أمر شائع في صور الهاتف وملفات المسح المتنوعة.
  3. إذا اخترت Recognize existing text again، لاحظ أن خيار Straighten tilted pages غير متاح في هذا الوضع.
  4. عندما تحتاج إلى إعادة القراءة من الصفر مع معالجة ملف غير متسق، قيّم خيار Treat every page as an image بعناية، مع قبول فقدان الروابط والنص القديم القابل للتحديد.

التصحيح لا يعالج كل مشكلات المصدر. القص الشديد عند حواف الصفحة، والانعكاسات، والظلال، وصورة غير واضحة أو صغيرة جداً تبقى عوامل مؤثرة. قبل معالجة أرشيف كبير، جرّب ملفاً قصيراً أو عدداً قليلاً من الصفحات وتحقق من الناتج أولاً.

كيف أتأكد أن OCR العربي نجح وأبحث في الـPDF؟

اختبر النسخة التي نزلتها عملياً. لا يكفي أن تظهر رسالة نجاح؛ فقد تختلف جودة التعرف بين صفحة وأخرى داخل المستند نفسه.

  1. افتح ملف PDF القابل للبحث في قارئ PDF المعتاد.
  2. ابحث عن كلمة مميزة تراها في الصفحة، مثل اسم شخص أو رقم فاتورة أو تاريخ. على الكمبيوتر استخدم Ctrl+F، أو Command+F في macOS. وعلى الهاتف، افتح قائمة العارض ثم اختر «بحث» أو رمز العدسة.
  3. جرّب البحث في صفحات من البداية والوسط والنهاية، لا في صفحة واحدة فقط.
  4. حدد جملة عربية قصيرة وانسخها إلى تطبيق ملاحظات، ثم قارنها بالصورة الأصلية.
  5. راجع بدقة الأسماء والعناوين وأرقام الهوية والحسابات والتواريخ والمبالغ. هذه المعلومات لا ينبغي الاعتماد عليها دون تدقيق بصري.

إذا كانت النتيجة ضعيفة، أعد العملية باختيار اللغة الصحيحة، وفعل تصحيح الميل أو الاتجاه عند الحاجة. أما إذا احتوى الملف على طبقة نص قديمة رديئة، فجرب Recognize existing text again أو Treat every page as an image وفق الحالة وحدود كل خيار.

هل أحوّل الـPDF بعد OCR إلى Word؟ وما الذي سيبقى قابلاً للتعديل؟

إذا كان هدفك البحث والنسخ، يكفي عادة ملف PDF القابل للبحث. وإذا احتجت ملف DOCX، فابدأ بـ OCR أولاً، ثم استخدم تحويل PDF إلى Word.

  1. أنشئ أولاً نسخة PDF قابلة للبحث بواسطة أداة OCR ونزّلها.
  2. افتح أداة PDF إلى Word واضغط «اختر ملفات PDF».
  3. اختر نسخة PDF التي عولجت بالتعرف على النص، وليس المسح الأصلي فقط.
  4. اضغط «تحويل إلى Word».
  5. نزّل المستند من زر Download the Word document، ثم افتحه في Word وراجعه قبل الاعتماد عليه.

من المهم فهم القيد الأساسي: أداة PDF إلى Word لا تجري التعرف على النص بنفسها. الصفحات الممسوحة التي لا تحتوي طبقة نص تضاف إلى مستند Word كصور، وليست كنص قابل للتحرير. لذلك لا تفترض أن تحويل المسح الأصلي مباشرة سيحوّل فقراته العربية إلى كتابة قابلة للتعديل.

حتى بعد OCR، تحقق يدوياً من الجداول، وتعدد الأعمدة، والحواشي، والنصوص فوق الصور. إذا أردت تصغير حجم ملف PDF الممسوح بعد العمل، يمكنك استخدام أداة compress، مع فحص الوضوح بعدها أيضاً.

كيف تُعالَج ملفات PDF في PDF Toucan؟

أداة OCR ليست معالجة محلية داخل المتصفح. يُرسل الملف عبر HTTPS إلى خوادم موجودة في الاتحاد الأوروبي لأن التعرف على النص يتطلب معالجة مكثفة. تتم المعالجة في الذاكرة، ولا يُكتب الملف على القرص أو يُخزّن.

يُحذف الملف عند تنزيل النتيجة، وبحد أقصى خلال 10 دقائق. يمكنك إضافة عدة ملفات، ويعالج كل ملف على حدة. هذه المعلومات مفيدة عند تقييم ملاءمة الخدمة لطبيعة مستندك، لكنها لا تلغي سياسات العمل أو المتطلبات التنظيمية الخاصة بجهتك.

تجنب إرسال ملفات لا تملك حق معالجتها، أو مستندات شديدة الحساسية إذا كانت سياسة المؤسسة تمنع استخدام خدمات الإنترنت لمعالجتها. وفي جميع الأحوال، احتفظ بالنسخة الأصلية غير المعدلة، خاصة إن كانت موقعة رقمياً أو مطلوبة كوثيقة رسمية.

أسئلة شائعة

هل يدعم OCR PDF عربي المستندات العربية والإنجليزية في الملف نفسه؟

نعم، اختر العربية والإنجليزية من Document language إذا كانت اللغتان موجودتين فعلاً في الصفحات. يمكن دمج حتى خمس لغات في العملية الواحدة. تجنب إضافة لغات غير مستخدمة، لأن ذلك يبطئ المعالجة وقد يقلل اتساق التعرف.

لماذا لا يجد البحث بعض الكلمات العربية بعد التعرف على النص؟

قد يكون السبب جودة المسح أو ميل الصفحة أو اختيار لغة غير مناسبة أو وجود ختم أو ظل فوق الكلمة. افحص الكلمة بالنسخ واللصق، ثم أعد تشغيل التعرف مع العربية الصحيحة وتصحيح الميل والاتجاه. راجع الأسماء والأرقام يدوياً دائماً.

هل يمكن تصحيح الصفحة المائلة والمقلوبة تلقائياً؟

نعم، فعّل Straighten tilted pages للصفحات المائلة وFix page orientation automatically للصفحات الجانبية أو المقلوبة. لكن تصحيح الميل غير متاح عند اختيار Recognize existing text again، لذا اختر الوضع المناسب حسب حالة طبقة النص الموجودة.

هل يصبح النص الممسوح قابلاً للتحرير عند تحويل PDF إلى Word؟

ليس بالضرورة. أداة PDF إلى Word تضيف الصفحات الممسوحة التي لا تحتوي نصاً كصور داخل DOCX. نفذ OCR أولاً كي تضيف طبقة نص إلى PDF، ثم حوّل النسخة الناتجة إلى Word وراجع الناتج، خصوصاً الجداول والتنسيقات المعقدة.

كيفية OCR PDF عربي عبر الإنترنت
كيفية OCR PDF عربي عبر الإنترنت

أدلة ذات صلة