بناء مجموعة اختبار ذهبية بخمسين سؤالًا
كيف تجمع خمسين سؤالًا حقيقيًّا وتوثّق إجاباتها لتصير معيارًا يقيس كل تغيير في نظامك، وأي فئات الأسئلة لا يجوز أن تنقص منها.
كل فريق يسألني «كيف نحسّن نظامنا؟» أسأله سؤالًا واحدًا: ما رقمك الحالي؟ الصمت الذي يتبع هو المشكلة الحقيقية. بلا معيار ثابت، التحسين انطباع، والانحدار لا يُكتشف إلا من شكوى مستخدم.
لماذا خمسون تكفي للبدء
الهدف من المجموعة الأولى ليس دقّة إحصائية عالية، بل كشف الأنماط الكبيرة: هل الاسترجاع يجد المستندات؟ هل النظام يمتنع عند حدوده؟ هل الجداول تُسترجَع أصلًا؟ خمسون سؤالًا موزّعة جيدًا تكشف هذا كله في جلسة واحدة. وحين تستقرّ، وسّعها إلى ٢٠٠–٣٠٠ لالتقاط الفروق الصغيرة.
من أين تأتي الأسئلة
من سجلّات المستخدمين، لا من خيال الفريق. الفريق يكتب أسئلة نظيفة كاملة الصياغة؛ المستخدم يكتب «الفاتورة ما ضبطت» و«كيف الغي». هذا الفارق هو ما يُسقط الأنظمة في اليوم الأول.
لا سجلّات بعد؟ استخرجها من تذاكر الدعم، وأسئلة الفريق الداخلية، والبحث داخل موقعك، ورسائل العملاء.
التوزيع الإلزامي
| الفئة | النسبة | تكشف |
|---|---|---|
| مباشرة (جوابها في مقطع واحد) | ٤٠٪ | الأساس |
| متعدّدة المصادر | ٢٠٪ | قدرة التجميع |
| غامضة أو ناقصة الصياغة | ٢٠٪ | التعامل مع الواقع |
| لا جواب لها في المستندات | ٢٠٪ | الامتناع بدل الهلوسة |
الفئة الأخيرة هي التي يحذفها الجميع لأنها «تُظهر النظام سيّئًا». وهي بالضبط ما يفصل نظامًا يُوثَق به عن نظام يخترع بثقة.
بنية الملف
{
"id": "q-014",
"question": "كم يوم إجازة الأبوّة؟",
"expected_source": "hr-policy-2026-03.md#leaves",
"reference_answer": "خمسة أيام عمل خلال الشهر الأول من الولادة.",
"category": "direct",
"should_answer": true
}
should_answer: false للأسئلة خارج النطاق — عندها يكون الامتناع هو الإجابة الصحيحة، وأي جواب آخر خطأ حتى لو بدا معقولًا.
احفظ الملف في المستودع وعامله كالكود: مراجعة، وتاريخ، وسبب لكل إضافة.
دورة الحياة
- عند كل بلاغ خطأ: أضف السؤال الذي كشفه إلى المجموعة. هكذا تنمو من الواقع لا من التخمين، ولا يتكرّر عطل صُحّح مرة.
- عند كل ميزة جديدة: أضف أسئلتها قبل إطلاقها.
- كل ربع: راجع الأسئلة التي صارت بلا معنى بعد تغيّر المنتج.
متى لا تكفي المجموعة الذهبية
هي مقياس ثابت، والواقع متغيّر. تحتاج معها: مراقبة إنتاج ترصد الأسئلة الجديدة، ومراجعة بشرية دورية لعيّنة من المحادثات، واختبارًا خصوميًّا يستدرج النظام عمدًا خارج نطاقه.
كيف تُراجَع المجموعة نفسها
المجموعة الذهبية أداة قياس، وأداة القياس تُعاير هي أيضًا. مراجعة ربع سنوية بأربعة أسئلة تكفي:
- هل ما زالت الأسئلة تشبه حركتك؟ قارن عيّنة من أسئلة المستخدمين هذا الشهر بأسئلة مجموعتك. إن كانت المجموعة تسأل عمّا لم يعد أحد يسأل عنه، فهي تقيس ماضيًا.
- هل هناك سؤال ينجح دائمًا منذ البداية؟ السؤال الذي لم يفشل قطّ لا يميّز بين نسختين، ولا يضيف معلومة. استبدله بأصعب منه.
- هل هناك سؤال يفشل دائمًا؟ إمّا أن الإجابة المرجعية خاطئة، أو أن السؤال خارج نطاق النظام أصلًا. الحالتان تستدعيان تصحيحًا لا تجاهلًا.
- هل تسرّبت المجموعة إلى المُوجّه؟ إن نُسخت أمثلة منها إلى أمثلة قليلة اللقطات داخل المُوجّه، فقد صارت جزءًا من النظام لا مقياسًا له. افصل الاثنين فصلًا صارمًا.
وقاعدة تحكم الإضافة: كل عطل حقيقي في الإنتاج يدخل المجموعة قبل إغلاق بلاغه. هذه هي الآلية الوحيدة التي تجعل المجموعة تنمو حيث يؤلم فعلًا، لا حيث يسهل التأليف.
الأخطاء الشائعة
- أسئلة يكتبها من بنى النظام — تقيس ما توقّعه لا ما يحدث.
- غياب فئة «لا جواب».
- إجابة مرجعية طويلة إنشائية يصعب مقارنتها؛ اجعلها مختصرة محدّدة.
- عدم تسجيل المقطع المتوقّع، فيتعذّر قياس الاسترجاع منفصلًا عن التوليد.
- تركها تتقادم بعد تغيّر المستندات.
الأسئلة الشائعة
كم من الوقت يستغرق بناؤها؟
يوم عمل واحد لخمسين سؤالًا مع مصادرها. وهو أفضل يوم تنفقه في المشروع كله: يوفّر أسابيع من الجدل حول «هل تحسّن؟».
هل أستعين بنموذج لتوليد الأسئلة؟
لتوسيع الصياغات نعم — خذ سؤالًا حقيقيًّا واطلب خمس صياغات له. أما توليد أسئلة من العدم فينتج توزيعًا مصطنعًا لا يشبه مستخدميك.
كيف أقيس عليها؟
احسب Recall@k وMRR للاسترجاع، ثم الإخلاص وملاءمة الجواب للتوليد، ثم — للأسئلة بلا جواب — نسبة الامتناع الصحيح. ثلاثة أرقام تكفي لقرار.
المراجع
- Es, S. et al. RAGAS: Automated Evaluation of Retrieval Augmented Generation. arXiv:2309.15217
- Zheng, L. et al. Judging LLM-as-a-Judge with MT-Bench. arXiv:2306.05685
- Thakur, N. et al. BEIR. arXiv:2104.08663
- Lewis, P. et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv:2005.11401
أدوات مذكورة في هذا المقال
اقرأ بعده
قياس الهلوسة: من الشكوى إلى رقم
تعريف إجرائي للهلوسة يمكن قياسه، وطريقة تفكيك الجواب إلى ادعاءات والتحقّق منها، ولماذا الجواب الصحيح غير المسنَد يُحسب هلوسة أيضًا.
اقرأ المقالحكم النموذج على النموذج: أين يصدق وأين ينهار
ما أثبتته ورقة MT-Bench عن اتفاق النماذج الحاكمة مع البشر، وثلاثة انحيازات موثّقة تفسد الحكم، وكيف تعاير حَكَمك قبل الاعتماد عليه.
اقرأ المقالتقييم أنظمة RAG: من الانطباع إلى رقم تثق به
كيف تبني مجموعة اختبار ذهبية في يوم، وأي المقاييس تخصّ الاسترجاع وأيها تخصّ التوليد، وماذا كشفت ورقة MT-Bench عن حدود حكم النموذج على النموذج.
اقرأ المقالنشرة إسناد الأسبوعية
ثلاثة أشياء مفيدة كل أسبوع: ورقة بحثية مشروحة، قياس عملي، وخطأ شائع رأيناه في الإنتاج. بلا حشو وبلا رعايات مخفية.