بيانات الذكاء الاصطناعي: لماذا الجودة أهمّ من الكمّية؟
شرح دقيق لبيانات الذكاء الاصطناعي: لماذا الجودة أهمّ من الكمّية، وكيف يتسرّب التحيّز من البيانات إلى المخرَج، مع أمثلة واقعية.
البيانات هي مجموعة الأمثلة — نصوص أو صور أو أصوات أو سجلّات — التي يتعلّم منها النموذج الأنماط. بدونها لا يستطيع تعلّم أي مهمة، سواء كانت التعرّف على الصور أو الترجمة أو الإجابة عن أسئلة.
لكن ليست كل البيانات متساوية. البيانات السيّئة تنتج نموذجًا سيّئًا حتى لو كانت ضخمة. والأخطر أن التحيّز فيها يتسرّب إلى المخرجات، فيسبّب قرارات غير عادلة.
ما هي بيانات التدريب؟
بيانات التدريب هي المجموعة التي يستعملها النموذج لتعلّم الأنماط. خلال التدريب يعدّل النموذج معاملاته الداخلية ليقلّل الفرق بين توقّعاته والإجابات الصحيحة.
مثال: لتدريب نموذج يميّز القطط من الكلاب، تُغذّيه بآلاف الصور المصنّفة. يتعلّم الأنماط البصرية التي تميّز كل فئة، ثم يطبّقها على صور جديدة لم يرها.
وفي النماذج اللغوية الكبيرة قد تكون البيانات تريليونات الكلمات من كتب ومقالات ومحادثات وكود، فيتعلّم منها الأنماط اللغوية والحقائق والأساليب. وتفصيل ذلك في كيف يُدرَّب نموذج ذكاء اصطناعي؟.
لماذا الجودة أهمّ من الكمّية؟
مقولة شائعة في المجال: «قمامة داخلة، قمامة خارجة». إن كانت بيانات التدريب تحوي أخطاء أو ضوضاء أو تحيّزًا، سيتعلّم النموذج هذه المشكلات ويكرّرها. وأسباب تفضيل الجودة ثلاثة:
- التعميم: النموذج المدرَّب على بيانات نظيفة يتعمّم أفضل على بيانات جديدة. والبيانات الضخمة المليئة بالأخطاء تنتج نموذجًا يخطئ كثيرًا.
- الكفاءة: التدريب على بيانات ضخمة يستهلك وقتًا وطاقة. وإن كان جزء كبير منها غير مفيد فهذا إهدار.
- التحيّز: البيانات غير المتوازنة تنتج نموذجًا متحيّزًا مهما كان حجمها.
كيف يتسرّب التحيّز إلى المخرَج؟
التحيّز ميل منهجي في النموذج لصالح مجموعة على أخرى. وهو لا يُخلَق من العدم بل يتسرّب من البيانات بأربع آليات:
١. التمثيل الناقص. حين تكون مجموعة ممثَّلة تمثيلًا ناقصًا، يتعلّم النموذج أنماطًا أقلّ دقة عنها. أنظمة التعرّف على الوجوه المدرَّبة على تنوّع محدود من البشرات تُخطئ أكثر خارج ذلك التنوّع.
٢. التمثيل الزائد. حين تهيمن مجموعة على البيانات، قد يعمّم النموذج أنماطها خطأً على غيرها. نموذج لغوي مدرَّب على الإنجليزية بنسبة غالبة يضعف في العربية.
٣. التحيّز التاريخي. البيانات قد تعكس تحيّزات اجتماعية سابقة. بيانات توظيف تاريخية قد تعكس تمييزًا، والنموذج المدرَّب عليها يكرّسه في توصياته.
٤. تحيّز التسمية. حين تكون التصنيفات نفسها خاطئة أو متحيّزة، يتعلّم النموذج هذا الخطأ ويعمّمه.
| نوع التحيّز | المصدر | مثال |
|---|---|---|
| تمثيل ناقص | بيانات غير متوازنة | تنوّع بشرات محدود في بيانات الوجوه |
| تمثيل زائد | هيمنة لغة أو ثقافة | غلبة النصوص الإنجليزية في نموذج لغوي |
| تحيّز تاريخي | بيانات تعكس ممارسات قديمة | بيانات توظيف تمييزية |
| تحيّز التسمية | خطأ أو تحيّز في التصنيف البشري | معايير جودة مطبَّقة بغير اتساق |
متى لا تحتاج إلى القلق من جودة البيانات؟
- عند استعمال نماذج جاهزة موثوقة: المزوّدون الكبار يبذلون جهدًا في تنقية البيانات.
- عندما تكون المهمة بسيطة وغير حسّاسة: التلخيص العام أو توليد الأفكار أقلّ تأثّرًا.
- عندما تتحقّق من المخرجات يدويًّا قبل النشر أو التنفيذ.
متى يجب أن تهتمّ بها؟
- عند بناء نموذج لمجال حسّاس: طبّ، أو قانون، أو توظيف — التحيّز قد يسبّب ضررًا حقيقيًّا.
- حين يخدم النموذج جمهورًا متنوّعًا: يجب أن تعكس البيانات هذا التنوّع.
- حين تكون البيانات من مصادر غير موثوقة: نصوص الإنترنت قد تحوي معلومات خاطئة ومحتوى ضارًّا.
وقبل استعمال أي مجموعة بيانات، اسأل: من جمعها ولماذا؟ هل تمثّل المجموعات المستهدفة بتوازن؟ هل مرّت بمراجعة بشرية؟ ما مصادرها الأصلية؟
الأسئلة الشائعة
هل يمكن القضاء على التحيّز تمامًا؟
لا بشكل كامل. قد يكون متأصّلًا في المصادر أو في عملية الجمع نفسها. لكن يمكن تقليله بتنويع المصادر وموازنة التمثيل وإزالة السمات الحسّاسة غير الضرورية.
هل البيانات الضخمة أفضل دائمًا؟
لا. بيانات ضخمة مليئة بالأخطاء قد تنتج نموذجًا أسوأ من نموذج أصغر مدرَّب على بيانات أنقى. والاتجاه البحثي الحديث يركّز على الجودة أكثر من الحجم.
كيف أكتشف التحيّز في بياناتي؟
افحص توزيع المجموعات المختلفة، واختبر النموذج على مجموعة اختبار متوازنة، واستعمل أدوات قياس الإنصاف المفتوحة المصدر.
هل التحيّز مشكلة في النماذج اللغوية وحدها؟
لا. يظهر في الرؤية الحاسوبية والصوت والتوصيات والقرارات المالية. أي نظام يتعلّم من بيانات قد يرث تحيّزاتها.
المراجع
- Mehrabi, N. et al. A Survey on Bias and Fairness in Machine Learning. arXiv
- Buolamwini, J. & Gebru, T. Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification. proceedings.mlr.press
- Gebru, T. et al. Datasheets for Datasets. arXiv
- NIST. Towards a Standard for Identifying and Managing Bias in Artificial Intelligence. nvlpubs.nist.gov
- Bender, E. et al. On the Dangers of Stochastic Parrots. dl.acm.org
اقرأ بعده
كيف يُدرَّب نموذج ذكاء اصطناعي؟ من البيانات إلى التكرار
شرح دقيق لدورة تدريب نموذج الذكاء الاصطناعي: البيانات، والخطأ، والتصحيح، والتكرار — ولماذا تكلّف كل دورة وقتًا وعتادًا باهظًا.
اقرأ المقالما هو النموذج؟ الفرق بين الخوارزمية والنموذج والمعاملات
شرح دقيق للنموذج في الذكاء الاصطناعي: الفرق بين الخوارزمية والنموذج والمعاملات، وأين يُخزَّن ما تعلّمه النموذج فعليًّا.
اقرأ المقالواجهة API للذكاء الاصطناعي: ما الذي ترسله وما يعود؟
شرح مبسّط لواجهة API للذكاء الاصطناعي: ما الذي ترسله إلى النموذج، وما الذي يعود، ولماذا لا يحتاج أغلب المطوّرين إلى تشغيل نموذج بأنفسهم.
اقرأ المقالنشرة إسناد الأسبوعية
ثلاثة أشياء مفيدة كل أسبوع: ورقة بحثية مشروحة، قياس عملي، وخطأ شائع رأيناه في الإنتاج. بلا حشو وبلا رعايات مخفية.