تقييم أنظمة RAG: من الانطباع إلى رقم تثق به
كيف تبني مجموعة اختبار ذهبية في يوم، وأي المقاييس تخصّ الاسترجاع وأيها تخصّ التوليد، وماذا كشفت ورقة MT-Bench عن حدود حكم النموذج على النموذج.
اقرأ المقالكل ما نشرناه في هندسة أنظمة الذكاء الاصطناعي التطبيقية — مرتّبًا من الأحدث، وكل مقال مسنود إلى مصدر أوّلي أو قياس منشور.
صفحة 8 من 8
كيف تبني مجموعة اختبار ذهبية في يوم، وأي المقاييس تخصّ الاسترجاع وأيها تخصّ التوليد، وماذا كشفت ورقة MT-Bench عن حدود حكم النموذج على النموذج.
اقرأ المقالالفرق بين النموذج ثنائي الترميز والنموذج التقاطعي، ولماذا ترفع إعادة الترتيب دقّة RAG، وكم مرشّحًا تُعيد ترتيبه قبل أن ينفجر زمن الاستجابة.
اقرأ المقالما أثبته تقييم BEIR عن ضعف النماذج الكثيفة خارج نطاق تدريبها، وكيف تدمج BM25 مع المتجهات بخوارزمية RRF، وأين تضع إعادة الترتيب دون أن ينفجر الكمون.
اقرأ المقاللماذا يفشل التقطيع بطول ثابت مع الجداول وملفات PDF والنصّ العربي، وأربع استراتيجيات بديلة، وما الذي يضيفه سياق المستند إلى كل مقطع بحسب تجارب الاسترجاع السياقي.
اقرأ المقالخط أنابيب الاسترجاع المعزّز بمراحله الست، وأين ينكسر فعلًا في الإنتاج، وما تقوله أوراق BEIR وDPR و«الضياع في المنتصف» عن كل قرار تتخذه فيه.
اقرأ المقال