استخراج النصّ من PDF العربية: الخطوة التي تُفسد كل ما بعدها
لماذا يخرج نصّ PDF العربي مقلوبًا أو ممزّقًا، وكيف تتعامل مع الجداول والأعمدة والمسح الضوئي، ولماذا لا ينفع أي تقطيع ذكيّ فوق نصّ مشوّه.
قبل أي حديث عن التقطيع ونماذج التضمين، هناك خطوة يتجاوزها الجميع بسطر واحد من الكود: تحويل ملف PDF إلى نصّ. وهي في المستندات العربية أكثر خطوة تُفسد المشروع بصمت.
لماذا PDF صعب أصلًا
PDF صيغة عرض لا صيغة محتوى: تصف أين يُرسم كل محرف على الصفحة، لا ما تعنيه الفقرات. استخراج النصّ عملية استنتاج لترتيب لم يُحفظ أصلًا. ومع العربية تتضاعف المشكلة:
- الاتجاه: بعض المولّدات تخزّن الحروف بترتيب العرض لا المنطق، فيخرج النصّ معكوسًا أو منفصل الحروف.
- التشكيل والمحارف المتصلة: قد تُستخرج رموزًا منفصلة أو تُفقد.
- الأعمدة: عمودان يُقرآن سطرًا بسطر عبر الصفحة فيختلط الكلام.
- الجداول: تتحوّل إلى صفّ أرقام بلا رؤوس.
قائمة فحص قبل بناء الفهرس
- اختر عشر صفحات ممثّلة (فيها جدول، وعمودان، وقائمة، وحواشٍ).
- استخرجها واقرأ الناتج بعينك.
- تحقّق من: اتصال الحروف · ترتيب الكلمات · بقاء رؤوس الجداول · عدم اختلاط الأعمدة · سلامة الأرقام.
- إن سقط شيء، عالِج الاستخراج قبل كل ما بعده.
هذه العشرون دقيقة توفّر أسابيع من مطاردة «لماذا لا يجد النظام هذه المعلومة؟»
معالجة الحالات الصعبة
الجداول: استخرجها كجداول لا كنصّ متدفّق، وحوّل كلًّا منها إلى Markdown يبقى وحدة واحدة عند التقطيع. وإن اضطُررت لتقسيم جدول طويل، كرّر صفّ الرؤوس في كل جزء — بلا الرؤوس تصير الأرقام بلا معنى.
الأعمدة: استعمل أداة تفهم مناطق الصفحة (layout) بدل قراءة تسلسلية. الأداة التي «تعمل» على مستند بسيط قد تخلط عمودين بلا أي رسالة خطأ.
المستندات الممسوحة ضوئيًّا: لا نصّ فيها أصلًا — صور. تحتاج OCR بمحرّك يدعم العربية، ثم مراجعة جودته: الأخطاء هنا تنتقل إلى الفهرس وتظهر لاحقًا كإجابات غريبة.
التطبيع بعد الاستخراج: وحّد الألف والهمزة والتاء المربوطة، واحذف التشكيل، ووحّد الأرقام، وأزل فواصل الأسطر داخل الفقرة الواحدة. وطبّق القواعد نفسها على الاستعلام لاحقًا وإلا اختلّ التطابق.
متى لا تستحقّ هذه المعالجة
إن كانت مستنداتك تُولَّد من نظامك أصلًا (تقارير أو صفحات ويب)، فاحفظ نسخة نصّية أو Markdown عند التوليد ولا تمرّ بـPDF إطلاقًا. أفضل معالجة لـPDF هي تفاديه.
كيف تحكم على جودة الاستخراج قبل أن تفهرس
الفهرسة فوق نصّ مشوّه تُنتج نظامًا يبدو عاملًا ويخطئ بهدوء. افحص قبلها:
- اسحب عيّنة عشوائية من عشرين صفحة عبر أنواع مستنداتك كلّها — لا عشرين صفحة متتالية من ملفٍ واحد نظيف.
- اقرأ النصّ المستخرَج بعينك، لا طوله ولا عدد رموزه. ابحث عن أربعة أعطال بعينها: حروف متقطّعة بلا وصل، وأرقام انقلب ترتيبها في السياق العربي، وأعمدة اندمجت في سطر واحد، وجداول تحوّلت إلى نصّ متّصل بلا حدود.
- احسب نسبة الصفحات السليمة. دون ٩٠٪ يعني أن مشكلتك في الاستخراج لا في الاسترجاع، وأي وقت تصرفه على ضبط الفهرس مهدور.
- افحص الحالات الحدّية عمدًا: صفحة فيها صورة ممسوحة، وصفحة فيها جدول، وصفحة فيها حواشٍ، وصفحة تخلط العربية بالإنجليزية. هذه أربعها تكسر أكثر مما تكسره الصفحات العادية.
- احتفظ برقم المرجع. أعد الفحص نفسه بعد أي تغيير في أداة الاستخراج، وقارن بالرقم السابق — وإلّا فأنت تبدّل أدوات على أمل لا على دليل.
المستند الذي يفشل هذا الفحص يُعالَج أو يُستبعَد. لا يُفهرَس ويُنسى.
الأخطاء الشائعة
- الثقة في أول أداة تعمل بلا فحص بصري للناتج.
- تجاهل الجداول لأنها «قليلة» — وهي غالبًا موضع الأرقام التي يسأل عنها المستخدمون.
- إهمال ترويسات الصفحات وتذييلاتها، فتتكرّر داخل كل مقطع وتلوّث التضمين.
- تطبيع النصّ في الفهرس دون الاستعلام، أو العكس.
- بناء الفهرس كاملًا قبل قراءة عيّنة من الناتج.
الأسئلة الشائعة
كيف أعرف أن الاستخراج سليم دون قراءة كل شيء؟
عيّنة عشوائية من عشر صفحات + بحث آليّ عن علامات التشوّه: حروف منفصلة متتالية، وأسطر شديدة القِصَر، ونسبة محارف غير عربية مرتفعة في مستند عربي.
هل أستعمل نموذجًا لغويًّا لتنظيف النصّ المستخرَج؟
مفيد في الحالات الصعبة، ومكلف على آلاف الصفحات، ويحمل خطر «تصحيح» يغيّر المعنى. جرّبه على العصيّ فقط بعد إصلاح الاستخراج نفسه.
ماذا أفعل بالحواشي والمراجع؟
افصلها عن المتن ولا تدمجها في المقاطع: تشوّش التضمين وتنتج استرجاعًا لمقاطع لا تحمل جوابًا. احتفظ بها في حقل منفصل إن احتجتها.
المراجع
- Anthropic. Introducing Contextual Retrieval. anthropic.com
- Lewis, P. et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401
- Gao, Y. et al. Retrieval-Augmented Generation for LLMs: A Survey. arXiv:2312.10997
اقرأ بعده
اختيار نموذج تضمين للعربية: منهجية قياس لا قائمة توصيات
لماذا لا تكفي لوحة MTEB لاختيار نموذج تضمين عربي، وكيف تبني اختبارًا على بياناتك في ساعتين، وأي أربعة معايير تحكم القرار فعلًا.
اقرأ المقالتقطيع المستندات العربية دون كسر المعنى
لماذا يفشل التقطيع بطول ثابت مع الجداول وملفات PDF والنصّ العربي، وأربع استراتيجيات بديلة، وما الذي يضيفه سياق المستند إلى كل مقطع بحسب تجارب الاسترجاع السياقي.
اقرأ المقالبناء مساعد دعم فني عربي: معمارية مرجعية
معمارية كاملة لمساعد دعم يجيب من مستنداتك بالعربية: الاستيعاب، الاسترجاع، التصعيد إلى إنسان، القياس، وحدود ما يجوز للنموذج أن يقوله.
اقرأ المقالنشرة إسناد الأسبوعية
ثلاثة أشياء مفيدة كل أسبوع: ورقة بحثية مشروحة، قياس عملي، وخطأ شائع رأيناه في الإنتاج. بلا حشو وبلا رعايات مخفية.