اقتصاد الاستدلال: خفض الفاتورة دون خفض الجودة
من أين تأتي تكلفة تشغيل نموذج لغوي فعلًا، وستّ روافع لخفضها مرتّبة بالعائد، وماذا تقول أوراق PagedAttention وFlashAttention وQLoRA لمن يستضيف بنفسه.
فاتورة الشهر الأول في الإنتاج مفاجأة متكرّرة: النموذج الذي كلّف دولارات في التجربة صار يكلّف مئات. والسبب غالبًا ليس عدد المستخدمين، بل بنية الطلب نفسها.
من أين تأتي التكلفة
في نظام RAG نموذجي، كل طلب يحمل: تعليمة نظام (٥٠٠ رمز) + خمسة مقاطع مسترجَعة (٣٠٠٠ رمز) + تاريخ محادثة (١٥٠٠ رمز) + سؤال (٥٠ رمزًا) ≈ ٥٠٥٠ رمز إدخال، مقابل ٢٥٠ رمزًا إخراجًا. الإدخال هنا أكثر من ٩٥٪ من الحجم.
الخلاصة الأولى إذن: حسّن ما يشكّل الحجم فعلًا، وابدأ بقياسه لا بافتراضه.
ستّ روافع مرتّبة بالعائد على الجهد
١) التخزين المؤقت للسياق
حين يتكرّر جزء ثابت في مقدّمة الطلبات — تعليمة نظام طويلة، تعريفات أدوات، مستند مرجعي — يتيح مزوّدو النماذج تخزينه مؤقتًا فلا يُعاد احتسابه بالكلفة الكاملة. الشرط أن يكون الجزء الثابت في المقدّمة وأن يبقى مطابقًا بايتًا ببايت. رتّب طلبك: [ثابت طويل] ثم [متغيّر قصير]. الوفر الذي يعلنه المزوّدون كبير على السياقات الطويلة، لكن حدوده وأسعاره تختلف بينهم — راجع توثيق مزوّدك ولا تنقل رقمًا من مزوّد إلى آخر.
٢) توجيه النماذج
ليست كل الأسئلة متساوية. مصنِّف صغير — أو قواعد بسيطة على طول السؤال ونوعه — يوجّه الأسئلة القصيرة المباشرة إلى نموذج أصغر، ويحتفظ بالكبير للمعقّد. هذه أعلى رافعة توفير في معظم الأنظمة، بشرط أن تقيس الجودة على المسارين بمجموعتك الذهبية قبل التبديل وبعده.
٣) ضغط السياق
- أعد ترتيب المرشّحين وأدخل ٣ مقاطع دقيقة بدل ١٠ عامة.
- لخّص تاريخ المحادثة بعد عدد من الأدوار بدل تمريره كاملًا.
- احذف من المقاطع ما لا يفيد الجواب: ترويسات، تذييلات، تكرار.
خفض الإدخال من ٥٠٠٠ إلى ٢٥٠٠ رمز يخفض نصف الفاتورة، وغالبًا يرفع الجودة أيضًا: أظهرت دراسة Lost in the Middle [1] أن دفن المعلومة وسط سياق طويل يخفض دقّة استعمالها، فالسياق الأنظف ليس أرخص فحسب بل أدقّ.
٤) الدفعات وغير المتزامن
المهام غير التفاعلية — تصنيف أرشيف، ملخّصات ليلية، إعادة معالجة مستندات — لا تحتاج استجابة فورية، وواجهات المعالجة على دفعات تقدّم خصمًا معتبرًا مقابل زمن تنفيذ أطول. افصل التفاعلي عن غيره وستكتشف أن جزءًا كبيرًا من حجمك يحتمل التأجيل.
٥) التكميم — للاستضافة الذاتية
تقليل دقّة الأوزان يقلّص الذاكرة ويسمح بتشغيل نموذج أكبر على عتاد أصغر. أثبتت ورقة QLoRA [2] أن الضبط الدقيق فوق أوزان مكمَّمة إلى ٤ بت ممكن عمليًّا مع حفاظ على جودة قريبة من الضبط بدقّة ١٦ بت، وهو ما جعل التعامل مع نماذج كبيرة على وحدة معالجة واحدة أمرًا واقعيًّا. القاعدة تبقى: قِس الجودة بعد التكميم على مهمتك أنت.
٦) محرّك خدمة كفؤ — للاستضافة الذاتية
إن كنت تشغّل النموذج بنفسك، فمحرّك الخدمة يحدّد الإنتاجية أكثر من العتاد. تدير آلية PagedAttention في vLLM [3] ذاكرة المفاتيح والقيم على نحو يشبه إدارة الصفحات في نظام التشغيل، وتقارير الورقة تضع المكسب في الإنتاجية عند مضاعفات مقارنةً بأنظمة الخدمة السابقة عند كمون مماثل. ويعمل FlashAttention [4] في طبقة أدنى: يقلّل حركة الذاكرة داخل حساب الانتباه نفسه فيسرّع التدريب والاستدلال معًا.
نقطة التعادل: واجهة برمجية أم استضافة ذاتية؟
تكلفة الواجهة البرمجية شهريًّا = (رموز الإدخال × سعر الإدخال) + (رموز الإخراج × سعر الإخراج).
تكلفة الاستضافة الذاتية شهريًّا = مجموع أربعة بنود:
- إيجار وحدات المعالجة الرسومية.
- التخزين ونقل البيانات.
- وقت المهندس: تشغيل ومراقبة وترقية.
- كلفة التعطّل حين ينقطع النظام.
البند الثالث هو المنسيّ دائمًا. تصبح الاستضافة الذاتية مبرَّرة عادةً عند اجتماع ثلاثة شروط: حجم مرتفع ومستقرّ يبقي العتاد مشغولًا، وقيد تنظيمي يمنع خروج البيانات، وفريق قادر على التشغيل. غياب أيّها يعيد الكفّة إلى الواجهات المُدارة.
المراقبة: ما لا يُقاس يتضخّم
- تكلفة لكل ألف طلب، وتكلفة لكل مستخدم نشط.
- توزيع رموز الإدخال (المئين ٥٠ و٩٥) — الذيل هو ما يفاجئك.
- نسبة إصابة التخزين المؤقت.
- نسبة الطلبات الموجَّهة إلى النموذج الصغير.
- الكمون: زمن أول رمز، والاستجابة الكاملة عند المئين ٩٥.
متى لا يستحق التحسين
إن كانت فاتورتك أقلّ من كلفة يوم عمل مهندس، فتحسين التكلفة إهدار للوقت. حسّن الجودة أولًا، واحتفظ بهذه الروافع حتى يصبح الرقم مؤثّرًا أو يفرضه نمو مفاجئ.
الأخطاء الشائعة
- تحسين طول الإجابة بينما الغالبية العظمى من الحجم في الإدخال.
- التبديل إلى الأرخص بلا قياس جودة — توفير يُدفع ثمنه في الدعم الفني.
- كسر التخزين المؤقت بوضع طابع زمني متغيّر في مقدّمة التعليمة.
- تمرير تاريخ المحادثة كاملًا في كل دور بلا سقف.
- حساب الاستضافة الذاتية بسعر العتاد وحده.
الأسئلة الشائعة
ما أسرع خفض تكلفة يمكن تطبيقه اليوم؟
تقليل عدد المقاطع الداخلة إلى السياق مع إعادة ترتيب جيدة، وترتيب الطلب لتفعيل التخزين المؤقت. كلاهما تغيير بسيط، وغالبًا بلا أثر سلبي على الجودة.
هل النموذج الأصغر يعني جودة أقل دائمًا؟
لا. في المهام المقيّدة بسياق مسترجَع — تلخيص مقطع، استخراج حقل، تصنيف نيّة — يكون الفارق ضئيلًا في أحيان كثيرة. الطريقة الوحيدة لمعرفة ذلك في حالتك هي القياس على مجموعتك الذهبية.
كم يوفّر التكميم فعلًا؟
يوفّر ذاكرة وعتادًا لا فاتورة واجهة برمجية، فهو مفيد للاستضافة الذاتية حصرًا. حجم التوفير ومقدار الخسارة في الجودة يعتمدان على النموذج وطريقة التكميم، ويجب قياسهما معًا لا الاكتفاء بأحدهما.
هل تلغي نافذة السياق الطويلة الحاجة إلى الاسترجاع لتوفير التكلفة؟
بالعكس. النافذة الأطول تغري بحشو المزيد، وهو أغلى وأبطأ وأحيانًا أقلّ دقّة. الاسترجاع الجيد يبقى وسيلة إدخال الأقلّ الأكثر صلة.
المراجع
- Liu, N. et al. Lost in the Middle: How Language Models Use Long Contexts. arXiv:2307.03172
- Dettmers, T. et al. QLoRA: Efficient Finetuning of Quantized LLMs. NeurIPS 2023. arXiv:2305.14314
- Kwon, W. et al. Efficient Memory Management for LLM Serving with PagedAttention. SOSP 2023. arXiv:2309.06180
- Dao, T. et al. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. arXiv:2205.14135
- Hoffmann, J. et al. Training Compute-Optimal Large Language Models (Chinchilla). arXiv:2203.15556
أدوات مذكورة في هذا المقال
اقرأ بعده
التخزين المؤقت للسياق: كيف تُرتّب طلبك ليعمل
كيف يعمل التخزين المؤقت للسياق، ولماذا يشترط أن يكون الجزء الثابت في المقدّمة ومطابقًا بايتًا ببايت، وأشهر خطأ يبطله بلا أن تلاحظ.
اقرأ المقالتوجيه النماذج: نموذج صغير لأسئلة سهلة
كيف توزّع الطلبات بين نموذج صغير وآخر كبير بقواعد أو مصنِّف، وكيف تقيس أثر التوجيه على الجودة قبل اعتماده، ومتى يكون التعقيد بلا مقابل.
اقرأ المقالالتكميم (Quantization): ما الذي تخسره فعلًا؟
كيف يقلّص التكميم ذاكرة النموذج، وماذا أثبتت QLoRA عن ضبط نماذج ضخمة على وحدة واحدة، ولماذا يجب قياس الخسارة على مهمتك لا على معيار عام.
اقرأ المقالنشرة إسناد الأسبوعية
ثلاثة أشياء مفيدة كل أسبوع: ورقة بحثية مشروحة، قياس عملي، وخطأ شائع رأيناه في الإنتاج. بلا حشو وبلا رعايات مخفية.