تخطَّ إلى المحتوى
إسنادISNAD
الأساسيات

النماذج اللغوية الكبيرة: كيف تتنبأ بالكلمة التالية ولماذا

شرح دقيق لكيفية عمل النماذج اللغوية الكبيرة عبر التنبؤ بالكلمة التالية، ولماذا تجعلها هذه الآلية بارعة في الصياغة وضعيفة في الحساب.

نُشر 5 دقائق قراءة

عندما تطلب من نموذج لغوي كبير كتابة فقرة، أو الإجابة على سؤال، أو حل مسألة رياضية، فإنه لا «يفكر» في الإجابة بالمعنى البشري. كل ما يفعله هو تخمين الكلمة — أو الرمز — التالي في السلسلة، ثم يكرر العملية حتى يكتمل النص.

هذه الآلية البسيطة، التنبؤ بالكلمة التالية (Next-Token Prediction)، هي سرّ براعة النماذج اللغوية في الصياغة، وهي أيضًا سبب ضعفها في الحساب والمنطق الدقيق. فهمها يساعدك على توقع متى ينجح النموذج ومتى يخطئ، وكيف تختار الأداة المناسبة لمهمتك.

كيف يتنبأ النموذج بالكلمة التالية؟

النموذج اللغوي الكبير (Large Language Model) نموذج تعلم آلي مُدرَّب على كميات ضخمة من النصوص. خلال التدريب يتعلم الأنماط الإحصائية التي تحكم تسلسل الكلمات في اللغة.

عندما تعطيه نصًا — يسمى «السياق» (Context) — يقوم بالخطوات التالية:

  1. تقسيم النص إلى رموز: يُقطَّع النص إلى وحدات صغيرة تسمى رموزًا (Tokens). الرمز قد يكون كلمة كاملة أو جزءًا من كلمة أو حرفًا واحدًا.
  2. حساب احتمالات كل رمز ممكن: بناءً على النص المدخل، يحسب النموذج احتمال ظهور كل رمز من مفرداته ككلمة تالية. المفردات قد تحتوي على عشرات الآلاف من الرموز.
  3. اختيار رمز واحد: يُختار رمز من التوزيع الاحتمالي — إمّا الأعلى احتمالًا، أو عشوائيًا من بين الأعلى لإضافة تنوع.
  4. إضافة الرمز وتكرار العملية: يُضاف الرمز المختار إلى النص، وتُعاد العملية مع النص الأطول، حتى يبلغ حدّ الطول أو يولّد رمز نهاية.

رياضيًا، النموذج يقدّر الاحتمال الشرطي: P(الرمز التالي | السياق) أي احتمال الرمز التالي بشرط النص السابق. وتفصيل الرموز نفسها في ما هو token؟.

لماذا تجعله هذه الآلية بارعًا في الصياغة؟

النماذج اللغوية تُدرَّب على كمّيات هائلة من النصوص: كتب، مقالات، كود برمجي، محادثات. خلال التدريب تتعلم:

  • القواعد النحوية: أي تسلسل كلمات يكون صحيحًا نحويًا.
  • الأساليب: كيف يكتب البشر نصوصًا رسمية وعامية وتقنية وإبداعية.
  • المعرفة الواقعية: حقائق وأسماء وتواريخ ومفاهيم ظهرت في النصوص التدريبية.
  • السياق الطويل: كيف ترتبط الجمل البعيدة بعضها ببعض في فقرة أو مقالة.

حين تطلب منه كتابة فقرة، لا «يفهم» الموضوع، بل يولّد التسلسل الأكثر احتمالًا للكلمات بناءً على ما رآه. هذا يجعله بارعًا في كتابة نصوص متماسكة، وتلخيص المقالات، والإجابة عن أسئلة عامة، وتوليد كود شائع الأنماط.

لماذا تجعله نفس الآلية ضعيفًا في الحساب؟

حين تسأله «ما ناتج 12345 × 67890؟» لا ينفّذ عملية ضرب. بل يتوقع التسلسل النصي الأكثر احتمالًا الذي يلي السؤال، بناءً على أمثلة مشابهة رآها في التدريب. وهذا يسبب مشكلتين:

١. الترميز يكسر الأرقام. الأرقام لا تُعالَج كقيم كمّية بل كسلاسل نصية. الرقم 12345 قد يُقسَّم إلى رموز مثل 1 و2 و34 و5. هذا يصعّب على النموذج تتبّع العلاقات الرياضية بينها.

٢. الهدف التدريبي هو التماسك لا الصحة. النموذج يُدرَّب ليقلّل خطأ التنبؤ بالكلمة التالية، لا ليتحقق من صحة الاستنتاجات الحسابية. قد يولّد حلًّا يبدو منطقيًا وفيه أخطاء في الخطوات الوسطى.

المهمة كيف يتعامل النموذج لماذا ينجح أو يفشل
كتابة فقرة متماسكة يتنبأ بالكلمات بناءً على أنماط لغوية ينجح: الأنماط اللغوية متكررة ومتسقة
الإجابة عن سؤال واقعي يسترجع أنماطًا مشابهة من التدريب ينجح جزئيًا: قد يخلط بين حقائق متشابهة
مسألة ضرب كبيرة يتوقع التسلسل النصي للإجابة، لا ينفّذ ضربًا يفشل: الترميز لا يحفظ البنية الرياضية
كود برمجي بسيط يتنبأ بتسلسلات كود شائعة ينجح جزئيًا: الكود المعقد قد يحوي أخطاء منطقية

متى لا تحتاج إلى فهم هذه الآلية؟

  • عند استخدام واجهات جاهزة لمهام بسيطة: تلخيص نصوص، أو توليد ردود، أو كتابة منشورات.
  • عند العمل في أدوار غير تقنية: مصممون، أو مديرو منتجات، أو كتّاب محتوى.
  • عندما تكون المهمة لغوية بحتة: كتابة أو تحرير أو ترجمة لا تتطلب دقة حسابية.

متى تحتاج إلى هذا الفهم بعمق؟

  • عند بناء تطبيقات تعتمد على نماذج لغوية: ستحتاج إلى اختيار استراتيجيات توليد، وضبط درجة الحرارة، وتصميم موجّهات فعّالة.
  • عند التعامل مع مهام حسابية أو منطقية: ستحتاج إلى دمج أدوات خارجية أو نماذج مخصّصة للاستدلال.
  • عند تقييم مخاطر النموذج: فهم حدود التنبؤ يساعد على توقع حالات الفشل مثل الهلوسة.

الأسئلة الشائعة

هل النموذج «يفهم» ما يكتبه؟

لا. يتنبأ بالرمز التالي بناءً على أنماط إحصائية تعلّمها. قد يبدو وكأنه يفهم، لكن ذلك نتيجة التدريب على كميات ضخمة من النصوص لا فهمًا حقيقيًا للمعنى.

لماذا يخطئ في مسائل حسابية بسيطة؟

لأنه لا ينفّذ عمليات حسابية فعلية. يتوقع التسلسل النصي للإجابة بناءً على أنماط مشابهة. الأرقام تُعالَج كنصوص، والهدف التدريبي لا يضمن صحة الحساب.

ما الفرق بين النموذج اللغوي ومحرك البحث؟

محرك البحث يسترجع صفحات موجودة من فهرس. النموذج يولّد نصًا جديدًا رمزًا تلو رمز. التفصيل في الفرق بين محرك البحث والنموذج اللغوي.

كيف تتحسّن دقّته في المهام الحسابية؟

باستخدام أدوات خارجية تنفّذ الحساب فعليًا، أو نماذج مُدرَّبة على الاستدلال الرياضي، أو تقنيات تشجّع النموذج على كتابة خطوات الحل قبل الإجابة النهائية.

المراجع

  1. Vaswani, A. et al. Attention Is All You Need. arXiv
  2. Brown, T. et al. Language Models are Few-Shot Learners. arXiv
  3. Hugging Face. How do Transformers work? huggingface.co
  4. Petrov, A. et al. Language Model Tokenizers Introduce Unfairness Between Languages. arXiv
  5. Cobbe, K. et al. Training Verifiers to Solve Math Word Problems. arXiv

اقرأ بعده

غلاف مقال: أول مشروع ذكاء اصطناعي: خطة عطلة نهاية أسبوع
الأساسيات6 دقائق قراءة

أول مشروع ذكاء اصطناعي: خطة عطلة نهاية أسبوع

خطة محدّدة لإنجاز أول مشروع ذكاء اصطناعي في عطلة واحدة: اختيار المهمة، وخط أساس قبل النموذج، وتجنّب تسريب البيانات، ونشر عرض مجاني.

اقرأ المقال

نشرة إسناد الأسبوعية

ثلاثة أشياء مفيدة كل أسبوع: ورقة بحثية مشروحة، قياس عملي، وخطأ شائع رأيناه في الإنتاج. بلا حشو وبلا رعايات مخفية.

النشرة البريدية لم تُفتَح بعد. حتى ذلك الحين، تصلك المقالات كاملةً عبر تغذية RSS.