التكميم (Quantization): ما الذي تخسره فعلًا؟
كيف يقلّص التكميم ذاكرة النموذج، وماذا أثبتت QLoRA عن ضبط نماذج ضخمة على وحدة واحدة، ولماذا يجب قياس الخسارة على مهمتك لا على معيار عام.
سؤال يتكرّر عند الاستضافة الذاتية: «هل أشغّل نموذجًا أكبر مكمَّمًا أم أصغر بدقّة كاملة؟» والجواب يحتاج فهم ما يفعله التكميم بالضبط.
الفكرة في سطرين
أوزان النموذج أعداد تُخزَّن عادةً بـ١٦ بت. التكميم يخزّنها بدقّة أقلّ — ٨ أو ٤ بت — فتنكمش الذاكرة المطلوبة انكماشًا يقارب النسبة بين الدقّتين. النتيجة العملية: نموذج لم يكن يسع في عتادك صار يسع.
| الدقّة | الذاكرة النسبية | الاستعمال المعتاد |
|---|---|---|
| 16-bit | الأساس | التدريب والاستدلال المرجعي |
| 8-bit | ~النصف | خسارة جودة صغيرة عادةً |
| 4-bit | ~الربع | استضافة ذاتية على عتاد محدود |
ما أثبتته QLoRA
قدّمت ورقة QLoRA [1] نتيجة غيّرت الممارسة: ضبط دقيق فوق نموذج أساس مكمَّم إلى ٤ بت — مع تدريب طبقات LoRA [2] الصغيرة فقط — أتاح ضبط نموذج بحجم ٦٥ مليار معامل على وحدة معالجة رسومية واحدة سعة ٤٨ غيغابايت، مع جودة قريبة من الضبط الكامل بدقّة ١٦ بت.
الدرس المستفاد ليس رقمًا يُحفَظ، بل أن التكميم لم يعد مقايضة خشنة: تقنياته الحديثة تحافظ على الجودة أفضل بكثير من الاقتطاع الساذج.
أين تظهر الخسارة عمليًّا
ليست موزّعة بالتساوي. من تجربتي ومن أنماط متكرّرة في التقارير:
- المهام المقيّدة بسياق (تلخيص مقطع، استخراج حقل، تصنيف نيّة): الأثر ضئيل غالبًا.
- الاستدلال متعدّد الخطوات والحساب: أكثر حساسية.
- اللغات الأقلّ تمثيلًا في التدريب — والعربية منها: قِس بنفسك ولا تعمّم من نتائج إنجليزية.
- المخرجات الطويلة: الأخطاء الصغيرة تتراكم عبر التوليد.
المقايضة الحقيقية
السؤال ليس «مكمَّم أم لا» بل: نموذج أكبر مكمَّم أم أصغر بدقّة كاملة؟ لا جواب عامًّا — الطريقة الوحيدة أن تشغّل الاثنين على مجموعتك الذهبية وتقارن ثلاثة أرقام: الجودة، والكمون، والذاكرة المشغولة.
متى لا يعنيك التكميم إطلاقًا
إن كنت تستعمل واجهة برمجية مُدارة. أنت تدفع مقابل الرموز لا مقابل الذاكرة، والمزوّد يقرّر تمثيله الداخلي. التكميم قرار من يشغّل النموذج بنفسه.
كيف تقيس الخسارة في نصف يوم
القياس هنا أرخص مما يبدو، ولا يحتاج بنية تقييم كاملة. الإجراء:
- اجمع خمسين إلى مئة مثال من حركتك الحقيقية — لا من أمثلة توضيحية. إن لم يكن لديك حركة بعد، فمن الأسئلة التي تتوقّعها بصياغة مستخدميك لا بصياغتك أنت.
- ثبّت كل شيء عدا الدقّة: النموذج نفسه، والمُوجّه نفسه، ودرجة الحرارة صفرًا، والبذرة نفسها إن كان محرّكك يدعمها. أي متغيّر ثانٍ يفسد المقارنة.
- شغّل النسختين وسجّل ثلاثة أرقام لكل مثال: صحّة المخرَج (حكم بشري أو مطابقة آلية)، والكمون حتى آخر رمز، وذروة الذاكرة المشغولة.
- قارن التوزيع لا المتوسّط. متوسّط متطابق قد يخفي عشرة أمثلة انهارت. انظر إلى أسوأ ١٠٪ تحديدًا — هي التي يراها مستخدمك ويشتكي منها.
- حدّد عتبة القبول قبل أن ترى النتيجة. «أقبل انخفاضًا حتى ثلاث نقاط مقابل مضاعفة السَّعة» قرارٌ يُتّخذ قبل القياس؛ بعده يصير تبريرًا.
نصف يوم عمل يغنيك عن جدال لا ينتهي حول رقم منشور عن نموذج غير نموذجك ومهمّة غير مهمّتك.
الأخطاء الشائعة
- اعتماد التكميم بناءً على معيار عام منشور بلا قياس محلّي.
- توقّع خفض في فاتورة الواجهة البرمجية.
- قياس الجودة وحدها بلا الكمون — بعض تقنيات التكميم تبطئ الاستدلال.
- نسيان أن الذاكرة تشمل ذاكرة المفاتيح والقيم التي تنمو مع طول السياق، لا الأوزان وحدها.
- تكميم نموذج مضبوط دقيقًا بلا إعادة تقييمه على مهمته.
الأسئلة الشائعة
٨ بت أم ٤ بت؟
ابدأ بـ٨ إن كان عتادك يحتمله: أقلّ خسارة وأبسط. انزل إلى ٤ حين يكون البديل نموذجًا أصغر بكثير — وحينها قارن الخيارين بالقياس لا بالانطباع.
هل يقلّل التكميم الدقّة على العربية أكثر؟
اللغات الأقلّ تمثيلًا في بيانات التدريب أكثر عرضة للتأثّر عمومًا، لكن المقدار يعتمد على النموذج والتقنية. هذا سبب كافٍ لجعل مجموعة اختبارك عربية لا مترجمة.
هل يمكن ضبط نموذج مكمَّم؟
نعم، وهذا بالضبط ما تقدّمه QLoRA: تجميد الأساس المكمَّم وتدريب طبقات صغيرة فوقه.
المراجع
- Dettmers, T. et al. QLoRA: Efficient Finetuning of Quantized LLMs. NeurIPS 2023. arXiv:2305.14314
- Hu, E. et al. LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685
- Kwon, W. et al. PagedAttention (vLLM). arXiv:2309.06180
- Hoffmann, J. et al. Training Compute-Optimal Large Language Models. arXiv:2203.15556
أدوات مذكورة في هذا المقال
اقرأ بعده
RAG أم ضبط دقيق؟ شجرة قرار بلا مجاملة
متى يحلّ الاسترجاع المشكلة ومتى يلزم الضبط الدقيق، وماذا غيّرت LoRA وQLoRA في معادلة الكلفة، ولماذا تبقى البيانات لا العتاد هي العائق الحقيقي.
اقرأ المقالاقتصاد الاستدلال: خفض الفاتورة دون خفض الجودة
من أين تأتي تكلفة تشغيل نموذج لغوي فعلًا، وستّ روافع لخفضها مرتّبة بالعائد، وماذا تقول أوراق PagedAttention وFlashAttention وQLoRA لمن يستضيف بنفسه.
اقرأ المقالتوجيه النماذج: نموذج صغير لأسئلة سهلة
كيف توزّع الطلبات بين نموذج صغير وآخر كبير بقواعد أو مصنِّف، وكيف تقيس أثر التوجيه على الجودة قبل اعتماده، ومتى يكون التعقيد بلا مقابل.
اقرأ المقالنشرة إسناد الأسبوعية
ثلاثة أشياء مفيدة كل أسبوع: ورقة بحثية مشروحة، قياس عملي، وخطأ شائع رأيناه في الإنتاج. بلا حشو وبلا رعايات مخفية.