GLM-5.3-Flash نموذج مفتوح بترخيص MIT يضم 320 مليار معلمة، لكن 18 مليار معلمة فقط تنشط لكل رمز. لذلك، رغم أن الحوسبة المطلوبة أقل من نموذج كثيف بالحجم نفسه، تبقى الذاكرة هي القيد الأساسي.
توضح هذه المقالة ما تحتاجه لتشغيل النموذج: عقدة إنتاج بالدقة الكاملة، أو إصدار GGUF مكمم على أجهزة أصغر، وكيف تحدد ما إذا كانت الاستضافة الذاتية تستحق ذلك.
ما الذي تحمّله؟
| الخاصية | القيمة |
|---|---|
| إجمالي المعلمات | 320 مليار |
| المعلمات النشطة لكل رمز | 18 مليار |
| البنية | MoE، اهتمام هجين خطي ومتباعد |
| طول السياق | 1,048,576 رمزًا |
| الترخيص | MIT |
| الأوزان | zai-org/GLM-5.3-Flash |
| تكميمات GGUF | unsloth/GLM-5.3-Flash-GGUF |
بنية مزيج الخبراء (MoE) تجعل التشغيل عمليًا: يجب أن تبقى المعلمات الـ320 مليارًا في الذاكرة، لكن 18 مليارًا فقط تشارك في توليد كل رمز. لذلك، خطط لسعة الذاكرة قبل التفكير في FLOPs.
تشير Z.ai أيضًا إلى أن ذاكرة التخزين المؤقت KV أصغر بنحو 4.4 مرات مقارنةً بـ GLM-5.3. هذا مهم جدًا مع السياقات الطويلة، لأن KV cache تنمو مع عدد الرموز وقد تصبح سبب نفاد الذاكرة قبل الأوزان نفسها.
المستوى 1: الدقة الكاملة للإنتاج
للتزامن الفعلي وجودة كاملة، استخدم عقدة 8x H200 بسعة 141 جيجابايت لكل GPU، أي نحو 1,128 جيجابايت إجمالًا. تعمل عقدة 8x H20 أيضًا.
تحتاج الأوزان وحدها إلى نحو 700–800 جيجابايت، إضافةً إلى KV cache ونفقات وقت التشغيل. تبلغ كلفة استئجار عقدة كهذه تقريبًا 24–48 دولارًا يوميًا.
التشغيل عبر vLLM
استخدم توازيًا تنسوريًا بقوة اثنين:
vllm serve zai-org/GLM-5.3-Flash \
--tensor-parallel-size 8 \
--max-model-len 1048576 \
--trust-remote-code
ابدأ بسياق أصغر من مليون رمز. تعيين --max-model-len 1048576 يحجز KV cache فورًا، وقد يظهر الفشل كخطأ نفاد ذاكرة بدلًا من مشكلة إعداد.
التشغيل عبر SGLang
يدعم SGLang النموذج منذ اليوم الأول، مع وصفات لـ H100 وH200 وB200 وB300 وGB200 وGB300، بما في ذلك الخدمة متعددة الوسائط. استخدمت Z.ai حزمة مبنية على SGLang قبل الإطلاق.
python -m sglang.launch_server \
--model-path zai-org/GLM-5.3-Flash \
--tp 8 \
--context-length 1048576
يميل SGLang إلى الأداء الجيد في المخرجات المنظمة وأحمال الوكلاء عالية التزامن، بينما يملك vLLM دعمًا أوسع في النظام البيئي. اختبر الاثنين على عبء عملك، خصوصًا إن كنت تشغل وكيل ترميز بدل واجهة دردشة.
يتطلب كلاهما إعداد محلل لاستدعاءات الأدوات إذا كنت تستخدم function calling. راجع وثائق الإصدار الذي تستخدمه، لأن أسماء المحللات تتغير.
المستوى 2: التكميم على أجهزة أصغر
تتوفر نسخ GGUF المكممة في unsloth/GLM-5.3-Flash-GGUF، بما في ذلك IQ1_S وIQ2_XXS. يمكن لتكميم 320B إلى 2 بت أن يضع الأوزان ضمن نطاق محطة عمل بذاكرة كبيرة أو عدة GPUs استهلاكية، خصوصًا مع تفريغ جزء من النموذج إلى CPU.
انتبه إلى نقطتين:
- التكميم القوي يخفض الجودة. IQ1_S ليس قريبًا من الدقة الكاملة. قد يكون التدهور ألطف في نموذج MoE مقارنةً بنموذج كثيف، لكن يجب تقييمه باستخدام مهامك ومخططات أدواتك الحقيقية.
- وثائق Unsloth لهذا النموذج ما زالت قيد العمل. تحقق من التكميمات والإعدادات المنشورة فعليًا قبل بناء بيئة إنتاج حولها.
للإعدادات الهجينة التي تعتمد على CPU، استخدم KTransformers: يحتفظ بخبراء MoE في RAM وينقل الضروري فقط إلى GPU. هذه البنية مناسبة جدًا لنموذج لا ينشط منه سوى 18 مليار معلمة لكل رمز. يُدرج TokenSpeed أيضًا ضمن أوقات التشغيل المدعومة.
لخطوات أصغر، راجع دليل تشغيل GLM-4.7-Flash محليًا، ودليل تشغيل GLM-5 محليًا مجانًا.
حدّد ميزانية الذاكرة
هناك رقمان يحددان صلاحية إعدادك:
- الأوزان: في BF16، تحتاج 320 مليار معلمة إلى نحو 640 جيجابايت قبل النفقات العامة، بمعدل يقارب 2 بايت لكل معلمة. يقلل FP8 ذلك إلى النصف تقريبًا، و4 بت إلى نحو 160 جيجابايت، بينما تقلل 2 بت الحجم أكثر مقابل خسارة ملموسة في الجودة.
- KV cache: تتوسع مع طول السياق والتزامن. قد يعمل إعدادك عند 8K ثم يفشل عند 128K بسبب نمو الذاكرة المؤقتة، لا بسبب الأوزان.
اضبط الخادم وفق طول السياق الذي تستخدمه فعلًا، لا الحد النظري البالغ مليون رمز. توفير نافذة لا تحتاجها هو أكثر الطرق شيوعًا لجعل النموذج يبدو غير قابل للتشغيل اقتصاديًا.
إذا كنت تتابع الإصدارات المفتوحة السابقة، فمقال استضافة GLM-5.3 ذاتيًا كُتب قبل إصدار Flash. أوزان Flash متاحة الآن بترخيص MIT، وهذه الإرشادات تحل محله.
الضبط الدقيق
يسمح ترخيص MIT بالضبط الدقيق وإعادة التوزيع، وهذا سبب قوي للاحتفاظ بالأوزان محليًا.
لكن الضبط الدقيق الكامل لنموذج 320B خارج نطاق معظم الفرق. استخدم LoRA أو أساليب فعالة للمعلمات، وفكّر في الجزء الذي ستكيّفه: الموجّه، الخبراء، أو طبقات الانتباه. في نماذج MoE، ما زالت هذه القرارات أقل استقرارًا من النماذج الكثيفة.
إذا كان هدفك تكييف المعرفة المجالّية، اختبر أولًا التحفيز والاسترجاع مع النموذج الأساسي. مع نافذة مليون رمز، قد يكون وضع المعرفة في السياق أرخص وأفضل من تدريب النموذج عليها.
إعدادات أخذ العينات
تنشر Z.ai هذه الإعدادات:
| حالة الاستخدام | temperature |
top_p |
|---|---|---|
| عام | 1.0 | 0.95 |
| ترميز | 0.95 | 1.0 |
يدعم النموذج أيضًا reasoning_effort بالقيم low وhigh وmax، وmax هو الافتراضي. على الأجهزة المحلية، استخدم low عندما تكون سرعة التوليد محدودة؛ فرمز الاستدلال هنا يكلّفك وقتًا فعليًا، لا رسوم API فقط.
هل الاستضافة الذاتية أوفر؟
غالبًا لا. بسعر معلن قدره 0.15 دولار لكل مليون رمز إدخال، تعادل عقدة 8x H200 مستأجرة بنحو 1,000 دولار شهريًا قرابة 6.7 مليار رمز إدخال عبر API. يتطلب تجاوز ذلك استخدامًا مستمرًا وكبيرًا جدًا.
تكلفة العقدة ثابتة سواء كانت خاملة أو مشغولة، بينما API تحاسبك على الاستخدام فقط. لذلك، اختر الاستضافة الذاتية لأسباب تشغيلية لا لأجل خفض التكلفة:
- إقامة البيانات والخصوصية.
- عدم وجود قيود معدل خارج سعتك.
- تقليل الاعتماد على توافر المورد أو تغيّر أسعاره.
- ترخيص MIT للتعديل والضبط الدقيق وإعادة التوزيع.
- امتلاك GPUs خاملة بالفعل، حيث تصبح التكلفة الهامشية هي الكهرباء.
للتفاصيل من جهة API، راجع تحليل الأسعار.
تحقّق من النشر
يوفر كل من vLLM وSGLang نقاط نهاية متوافقة مع OpenAI:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"messages": [{"role": "user", "content": "reply with OK"}]
}'
لا تكتفِ بفحص استجابة واحدة. اختبر:
- طول السياق الذي يحتاجه تطبيقك فعليًا.
- إدخال الصور إذا كنت تستخدم الخدمة متعددة الوسائط.
- استدعاءات الأدوات باستخدام مخططاتك الحقيقية.
- الإنتاجية تحت التزامن، لا زمن استجابة طلب واحد فقط.
وجّه Apidog إلى خادمك المحلي ونقطة نهاية Z.ai باستخدام عنوان URL الأساسي كمتغير بيئة، ثم شغّل حزمة الاختبارات نفسها على الاثنين. سيوضح ذلك سريعًا ما إذا كان الإصدار المكمم ما زال يتعامل مع مخططات الأدوات التي يعتمد عليها تطبيقك.
الأسئلة الشائعة
ما الحد الأدنى من الأجهزة؟
للدقة الكاملة، عقدة من فئة 8x H200. أما إصدارات GGUF المكممة فتحتاج أقل بكثير، مع انخفاض الجودة كلما زادت شدة التكميم.
هل يجب أن تكون المعلمات الـ320 مليار كلها في الذاكرة؟
نعم. تنشط 18 مليار معلمة فقط لكل رمز، لكن النموذج الكامل يجب أن يكون متاحًا في الذاكرة. الذاكرة هي القيد الأساسي، لا الحوسبة.
أيهما أفضل: vLLM أم SGLang؟
يدعم SGLang الوسائط المتعددة منذ البداية وقد يتفوق في التزامن والمخرجات المنظمة. يملك vLLM دعمًا أوسع في النظام البيئي. قارن كليهما على عبء عملك.
هل يمكن تشغيله على GPU واحد؟
ليس بالدقة الكاملة. يمكن أن يكون ممكنًا مع تكميم قوي وتفريغ إلى CPU باستخدام KTransformers، بشرط وجود RAM كبيرة، لكن توقّع سرعة توليد منخفضة.
هل الترخيص فعلًا MIT؟
نعم. الأوزان منشورة بترخيص MIT، ما يسمح بالاستخدام التجاري والتعديل وإعادة التوزيع.
Top comments (0)