أصدرت Z.ai نموذج GLM-5.3-Flash في 26 أغسطس 2026: نموذج مزيج خبراء (MoE) يضم 320 مليار معامل، منها 18 مليار نشطة، بترخيص MIT، ويدعم الصور أصليًا بدل الاعتماد على محول رؤية منفصل.
كان النموذج متاحًا بالفعل لمدة أسبوع باسم ox-alpha قبل الإعلان الرسمي عنه. رغم اسم “Flash”، ميزته الأساسية ليست سرعة التوليد، بل خفض التكلفة والذاكرة مع دعم متعدد الوسائط أصيل.
خلاصة سريعة
- النموذج: GLM-5.3-Flash من Z.ai، مفتوح الأوزان بترخيص MIT.
- الحجم: 320 مليار معامل إجمالًا، و18 مليار معامل نشط.
- السياق: 1,048,576 رمزًا.
- المدخلات: نصوص، صور، فيديو، وملفات.
- السعر المعلن: 0.15 دولار لكل مليون رمز إدخال و0.50 دولار لكل مليون رمز إخراج، أي قرابة عُشر تكلفة GLM-5.2.
- السرعة: نحو 48.7 رمز إخراج/ثانية؛ ليس أسرع من GLM-5.3، لكنه يبدأ الاستجابة بسرعة جيدة: 1.52 ثانية لأول رمز.
-
معرف API:
glm-5.3-flash -
Hugging Face:
zai-org/GLM-5.3-Flash
| الخاصية | القيمة |
|---|---|
| إجمالي المعاملات | 320 مليار |
| المعاملات النشطة | 18 مليار |
| البنية | مزيج خبراء مع انتباه خطي ومبعثر هجين |
| الترخيص | MIT |
| نافذة السياق | 1,048,576 رمزًا |
| المدخلات | نص، صورة، فيديو، ملفات |
| المخرجات | نص |
| أنماط الاستدلال |
منخفض، مرتفع، أقصى — الافتراضي أقصى
|
| معرف API | glm-5.3-flash |
هناك اختلاف بين المزودين حول الحد الأقصى للإخراج: يسرد OpenRouter 131,072 رمزًا، بينما تشير بطاقة Hugging Face إلى 163,840. لم تنشر Z.ai رقمًا نهائيًا، لذا تحقّق من حد مزودك قبل بناء مهام توليد طويلة جدًا.
تعدد الوسائط الأصيل
في الإصدارات السابقة، كانت الرؤية تأتي عبر نماذج أو مسارات منفصلة، مثل GLM-5V-Turbo وGLM-4.6V. أما GLM-5.3-Flash فيستقبل النصوص والصور والفيديو والملفات داخل طلب إكمال دردشة واحد.
هذا يسمح، مثلًا، بإرسال مواصفات طويلة مع لقطة شاشة لل العرض وتفاعلات المستخدم، ما يجعله مناسبًا لوكلاء البرمجة واختبارات الواجهات.
للمسار الأقدم للرؤية المخصصة، راجع دليل واجهة GLM-5V-Turbo API، ولمعالجة المستندات راجع GLM-OCR لفهم المستندات.
الهندسة المعمارية وما تعنيه عمليًا
يعتمد النموذج على بنية جديدة بدل إعادة تدريب GLM-5.2، مع عنصرين رئيسيين:
- الانتباه الهجين: يجمع الانتباه الخطي للتبعيات المحلية مع الانتباه المبعثر للوصول إلى الرموز المهمة عالميًا. النتيجة المعلنة: حوسبة انتباه أقل بنحو 3× من GLM-5.3 وذاكرة KV Cache أصغر بنحو 4.4×.
- الروابط الفائقة المقيدة بالمتشعبات: تسمية Z.ai لتحسين كفاءة التوسع. لا توجد تفاصيل عامة كافية للتحقق المستقل من أثرها.
تقليص ذاكرة KV Cache هو الأثر العملي الأهم: فهو يقلل متطلبات الذاكرة في الاستدلال طويل السياق، ويساعد على تقديم نافذة 1M بتكلفة تقارب عُشر GLM-5.2. وتصف Z.ai بيانات التدريب بأنها تضم نحو 30 تريليون رمز متعدد الوسائط.
لماذا “Flash” لا تعني سرعة توليد أعلى
يقيس Artificial Analysis سرعة GLM-5.3-Flash عند 48.7 رمز إخراج في الثانية، بينما يبلغ GLM-5.3 نحو 86 رمزًا/ثانية. لذلك، لا تختَر Flash إذا كانت أولوية حملك هي بث نصوص طويلة بأعلى إنتاجية.
لكن زمن أول رمز يبلغ 1.52 ثانية، مقابل متوسط 2.14 ثانية لنماذج الأوزان المفتوحة، ما يجعله مناسبًا لتفاعلات قصيرة ومتعددة.
الخلاصة:
- اختره من أجل السعر الأقل، استهلاك الذاكرة الأقل، ودعم الصور والفيديو والملفات.
- لا تختره متوقعًا سرعة بث أعلى من GLM-5.3.
المقاييس المعيارية
الأرقام المنشورة عند الإطلاق هي ادعاءات من Z.ai إلى أن يعيد طرف ثالث إنتاجها. القياس المستقل من Artificial Analysis يمنح GLM-5.3-Flash 57 نقطة على مؤشر الذكاء الإصدار 4.1.1، مقابل 60 لـ GLM-5.3 ومتوسط 27 للنماذج المفتوحة ذات الحجم المشابه.
تصف Z.ai النموذج بأنه يقترب من Claude Opus 4.8 في البرمجة والمهام الوكيلة، لكن هذا تقييم داخلي من البائع وليس قياسًا مستقلًا.
لمزيد من السياق حول المقاييس، راجع تحليل معايير GLM-5.2.
أسبوع Ox Alpha
في 20 أغسطس، ظهر نموذج مجهول باسم ox-alpha على منصات استدلال خارجية بسياق 1M رمز وسعر مجاني، وأصبح شائعًا خلال أيام. تعرّف المجتمع عليه كنموذج من Zhipu خلال نحو 48 ساعة استنادًا إلى خصائص المخرجات.
في 26 أغسطس، أكدت Z.ai أن ox-alpha كان GLM-5.3-Flash، وأن الأسبوع المجاني كان اختبار ضغط متعمدًا.
تقول Z.ai إن حركة المرور خلال ذلك الأسبوع خُدمت على مسرّعات صينية محلية باستخدام مكدس يعتمد على SGLang، وبكلفة لكل رمز مماثلة لأجهزة NVIDIA السائدة. هذا ادعاء بنية تحتية من البائع، ولا يوجد تحقق مستقل منه.
هذا النمط ليس جديدًا؛ راجع قصة Pony Alpha: هل كان نموذج DeepSeek أم GLM؟.
كيفية استخدام GLM-5.3-Flash
واجهة API المستضافة
واجهة Z.ai متوافقة مع OpenAI. وجّه عميلك إلى:
https://api.z.ai/api/paas/v4/
ثم استخدم معرف النموذج:
glm-5.3-flash
يغطي دليل GLM-5.3-Flash API المصادقة، وطلبات إدخال الصور، ومعامل جهد الاستدلال.
مزودو الجهات الخارجية
يتوفر النموذج عبر:
- OpenRouter باسم
z-ai/glm-5.3-flash - Cloudflare Workers AI
- Vercel AI Gateway
- DeepInfra
- Novita
- GMICloud
- Baseten
- io.net
قارن الأسعار بين المزودين قبل الاعتماد على واحد منهم، إذ قد تختلف بصورة ملحوظة.
وكلاء البرمجة
يتضمن Flash في خطة GLM للبرمجة، ويقال إن حصته القابلة للاستخدام تبلغ ثلاثة أضعاف GLM-5.3. وتشير وثائق Z.ai إلى أن الاستدعاءات خارج أوقات الذروة تستهلك نصف النقاط المعتادة.
الاستضافة الذاتية
الأوزان متاحة بترخيص MIT على Hugging Face، ويدعمها:
- vLLM
- SGLang
- TokenSpeed
- KTransformers
- تحويلات GGUF للأجهزة الأصغر
متى تستخدمه؟
استخدم GLM-5.3-Flash عندما تحتاج إلى:
- فهم الصور أو الفيديو مع النص في الطلب نفسه.
- تقليل تكلفة الرموز.
- تشغيل نموذج مفتوح الأوزان بترخيص متساهل.
- معالجة سياقات طويلة مع متطلبات ذاكرة أقل.
استخدم GLM-5.3 بدلًا منه عندما تحتاج إلى:
- أعلى جودة استدلال ممكنة.
- إنتاجية توليد أعلى للنصوص الطويلة.
راجع مقارنة GLM-5.3-Flash وGLM-5.3 وما هو GLM-5.3؟ قبل اتخاذ القرار.
الانتقال بين النموذجين بسيط: غيّر معرف النموذج في نقطة نهاية متوافقة مع OpenAI، ثم اختبر حمل العمل الحقيقي بدل الاعتماد على جداول المقارنات فقط.
اختبر طلباتك النصية ومتعددة الوسائط الفعلية واحفظها مع تأكيدات قابلة لإعادة الاستخدام في Apidog. بهذه الطريقة يمكنك التحقق من أن شكل الاستجابة لم يتغير عند التبديل من GLM-5.3 إلى Flash قبل وصول التغيير إلى الإنتاج.
الأسئلة الشائعة
هل GLM-5.3-Flash مجاني؟
لا. انتهى أسبوع Ox Alpha المجاني عند الإعلان الرسمي. يوجد خصم إطلاق بنسبة 50% حتى 9 سبتمبر 2026، ثم تطبق أسعار القائمة.
هل هو أسرع من GLM-5.3؟
لا. يولد نحو 49 رمزًا/ثانية مقابل 86 رمزًا/ثانية لـ GLM-5.3، لكنه يبدأ الاستجابة أسرع بزمن أول رمز يبلغ 1.52 ثانية.
هل يدعم مليون رمز من السياق؟
نعم، نافذته 1,048,576 رمزًا. يسرد OpenRouter رقمًا أعلى قدره 1,310,720، ويجب التعامل معه كحد خاص بالمزود لا كمواصفة نهائية للنموذج.
هل يقبل الفيديو؟
نعم. تسرد وثائق Z.ai النصوص والصور والفيديو والملفات كمدخلات، لكن اختبر الفيديو بوسائطك الفعلية قبل الاعتماد عليه في الإنتاج.
ما ترخيص الأوزان؟
MIT، والأوزان منشورة باسم zai-org/GLM-5.3-Flash على Hugging Face.



Top comments (0)