DEV Community

Cover image for كيف يتوقف GLM-5.3-Flash غير المقيد عن رفض العمل المشروع
Yusuf Khalidd
Yusuf Khalidd

Posted on Originally published at apidog.com

كيف يتوقف GLM-5.3-Flash غير المقيد عن رفض العمل المشروع

GLM-5.3-Flash غير الخاضع للرقابة: ما الذي نعرفه وكيف نقيّمه؟

خلاصة: نشرت OrcaRouter أوزانًا أزيلت منها قيود الرفض لنموذج GLM-5.3-Flash، وهو نموذج خليط خبراء يضم 320 مليار معامل، منها 18 مليارًا نشطًا. صدر أولًا بتنسيق block-FP8 في 29 أغسطس 2026، ثم بتنسيق NVFP4 لوحدات معالجة الرسوميات من NVIDIA في 31 أغسطس. تتوفر الآن تحويلات GGUF وMLX أيضًا. ووفقًا لأرقام الناشر، انخفض الرفض في MaliciousInstruct من 96% إلى 11%، لكنه لم يصل إلى الصفر. والأهم أن OrcaRouter تقول إن جزءًا من محاذاة GLM-5.3-Flash لا يعتمد على اتجاه رفض خطي واحد، ما قد يشير إلى أن تدريب الأمان لدى Z.ai أعمق بنيويًا من النماذج التي تستهدفها هذه التقنية عادةً.

جرّب Apidog اليوم

أصبحت إزالة القيود من النماذج المفتوحة عملية مألوفة: تحديد اتجاه التنشيط المرتبط بالرفض، إزالته من الأوزان، ثم نشر النموذج الناتج. لكن إصدار GLM-5.3-Flash يستحق القراءة لسبب يتجاوز انخفاض معدلات الرفض: قد يكشف عن حدود هذا النموذج الذهني نفسه.

إصدار GLM-5.3-Flash غير الخاضع للرقابة

ما الذي أطلقته OrcaRouter؟

أعلنت OrcaRouter عن إصدارين رئيسيين خلال يومين، ثم أضافت تنسيقات أخرى لاحقًا:

  • 29 أغسطس 2026 — block-FP8: الإصدار الأصلي، من دون إعادة تكميم بين النموذج الأساسي والنموذج المعدل. يحتفظ ببنية GLM-5.3-Flash نفسها: 320 مليار معامل و18 مليارًا نشطًا. تجاوز الإعلان مليوني مشاهدة.
  • 31 أغسطس 2026 — NVFP4: إصدار يستهدف تنسيق NVIDIA ذي 4 بت، مع حجم أصغر واستدلال أسرع. حقق نحو 75,000 مشاهدة، ما يعكس جمهوره الأضيق.
  • لاحقًا — GGUF وMLX: يتوفر GLM-5.3-Flash-Uncensored-GGUF لمسار llama.cpp، وGLM-5.3-Flash-Uncensored-MLX لأجهزة Apple Silicon. عند التحقق في 1 سبتمبر 2026، كانت التنزيلات لكلا التنسيقين صفرًا، مقابل خمس تنزيلات لـNVFP4 و1,541 للإصدار الأصلي FP8.

للمقارنة، تستضيف المنظمة نفسها إصدارات معدلة من Qwen3.8-27B، الذي تجاوزت تنزيلات إصدار FP8 منه 300,000، إضافة إلى Qwen3.8-Flash-Next وGemma-4-26B. لذلك فإن إصدار GLM إضافة إلى خط إنتاج قائم، وليس تجربة منفردة.

الأوزان مرخصة بترخيص MIT، وتدرج zai-org/GLM-5.3-Flash كنموذج أساسي. وتصف بطاقة النموذج الإصدار بأنه:

  • معدل أو abliterated
  • لغوي بصري
  • خليط خبراء (MoE)
  • قادر على استدعاء الوظائف

وهذا يعني أن إمكانات الرؤية واستدعاء الأدوات في النموذج الأساسي تظل جزءًا من الإصدار.

للتفاصيل الأساسية، راجع ما هو GLM-5.3-Flash وكيف يقارن بـ GLM-5.3، واطّلع على إصدار OrcaRouter.

ما معنى «لا LoRA ولا موجه اختراق»؟

هناك ثلاثة أساليب مختلفة غالبًا ما تختلط في النقاش:

  • موجه الاختراق (jailbreak prompt): يحاول تجاوز التدريب الأمني وقت الاستدلال. لا يتغير النموذج، ويُستهلك جزء من السياق، كما أن الأسلوب قد يتوقف عن العمل بعد تحديثات الموفر.
  • محوّل LoRA: أوزان إضافية تُحمّل مع النموذج ويمكن فصلها عنه. النموذج الأساسي لا يتغير.
  • إزالة القيود أو التعديل الجذري: تعديل الأوزان نفسها لإزالة اتجاه تنشيط يرتبط بسلوك الرفض. لا توجد طبقة إضافية لإرفاقها أو إزالتها.

النتيجة العملية هي أن فحص النموذج بحثًا عن محولات أو موجهات لا يكفي. يجب التحقق من مصدر الأوزان، والنموذج الأساسي، ونقطة التحقق المستخدمة فعليًا. وهذا يجعل نسب النموذج جزءًا من سلسلة التوريد، مثلما تصبح [حواجز حماية وكلاء الذكاء الاصطناعي](https://apidog.com/ar/blog/ai-agent-guardrails?utm_source=devاح عند كتابة المقال:

المعيار الرفض الأساسي بعد إزالة القيود
MaliciousInstruct 96% 11%
JailbreakBench 93% 12%
AdvBench 97% 15%
HarmBench 93% 18%
XSTest — الرفض الزائد للطلبات الحميدة 2.4% 0.4%

يجب قراءة الصف الأخير بطريقة مختلفة. يقيس XSTest الرفض الزائد: رفض طلبات سليمة لأنها تشبه ظاهريًا طلبات خطرة. أمثلة ذلك:

  • رفض تصحيح تدفق تسجيل الدخول بسبب ظهور كلمة «كلمة مرور».
  • رفض كتابة ماسح منافذ للبنية التحتية التي تملكها.
  • رفض تلخيص تقرير تهديد لأنه يصف تهديدات.

انخفاض الرفض الزائد من 2.4% إلى 0.4% هو الفائدة اليومية الأكثر واقعية للمطورين. أما الصفوف الأربعة الأولى فهي التي تجعل النموذج أداة بحث حساسة، لا بديلًا إنتاجيًا آمنًا تلقائيًا.

مقارنة معدلات الرفض

ما الذي تكسبه فعليًا؟

1. رفض أقل للعمل المشروع

التحسن في XSTest قد يظهر مباشرة في العمل اليومي: محاولات أقل، وموجهات معاد صياغتها أقل، ومهام مهجورة أقل.

2. لا ضريبة لكل طلب

لا تحتاج إلى التحايل على الرفض في كل استدعاء. وبما أن التعديل موجود في الأوزان، فإن السلوك أكثر ثباتًا من موجهات الاختراق، ولا يعتمد على تحديثات مزود خارجي.

3. تحكم كامل في النشر

أوزان MIT قابلة للاستضافة الذاتية والتثبيت عند نقطة تحقق محددة. يمكن أن تبقى الموجهات والمستندات داخل بنيتك التحتية، بدل إرسالها إلى مزود قد يغير سياساته فجأة. راجع استضافة أوزان GLM-5.3 المفتوحة ذاتيًا.

4. بقاء إمكانات النموذج الأساسي

الإصدار ليس نموذجًا نصيًا فقط؛ فالرؤية واستدعاء الوظائف ما زالا مدرجين في بطاقة النموذج. وهذا مهم عند استخدامه في أنظمة الوكلاء.

لكن لا توجد هنا زيادة في القدرة. إزالة القيود تعديل سلوكي، وقد ترتبط هذه التقنية بتكاليف في الجودة. لم تذكر الإعلانات ما إذا كانت قدرات الاستدلال أو البرمجة أو الرؤية تغيرت مقارنة بالنموذج الأساسي. لذلك أنت تستبدل انخفاض الرفض بمخاطرة غير مقاسة في التدهور، وتتحمل بنفسك كل قرار تصفية كان النموذج الأساسي يتخذه.

النتيجة الأهم: الرفض لم يصل إلى الصفر

بعد التعديل، بقيت معدلات الرفض بين 11% و18%. تفسر OrcaRouter ذلك بأن جزءًا من محاذاة GLM-5.3-Flash لا يتم تمثيله بواسطة اتجاه رفض خطي واحد، وأن Z.ai ربما استخدمت آلية رفض أعمق بنيويًا.

هذا ادعاء عن البنية الداخلية للنموذج، وإذا أكدته اختبارات مستقلة فسيكون أهم من نقطة التحقق نفسها.

النموذج الذهني الشائع لإزالة القيود يفترض أن الرفض اتجاه واحد تقريبًا في مساحة التنشيط: حدده، أزله، ثم ينهار السلوك. نجاح التقنية في خفض الرفض من 96% إلى 11% ثم توقفها عند هذا الحد يشير إلى أن هذا النموذج غير مكتمل، على الأقل بالنسبة إلى GLM-5.3-Flash.

هناك تفسيران محتملان:

  1. بعض المحاذاة موزع أو غير خطي، فلا تصل إليه التقنية.
  2. تنفيذ OrcaRouter لم يستخرج كل السلوك المرتبط بالرفض.

في كلتا الحالتين، لا يمثل معدل رفض متبقٍ قدره 11% أو 18% ميزة أمان. نموذج يرفض 15% من الطلبات الضارة ليس نموذجًا آمنًا؛ بل نموذجًا غير موثوق.

بنية نموذج GLM-5.3-Flash

ادعاءات تحتاج إلى تحقق

«ذكاء بمستوى Claude Opus 4.8»

وصف منشور متابعة الإصدار النموذج بأنه يمنح المدافعين ذكاءً بهذا المستوى، لكنه لم يقدم معيارًا يدعم المقارنة، كما أنها مقارنة بإصدار ليس من جيل Opus الحالي. تعامل مع هذا باعتباره تسويقًا، وأجرِ تقييمك الخاص إذا كانت القدرة مهمة لحالة الاستخدام.

انخفاض الرفض لا يساوي قدرة أعلى

معدل الرفض مقياس سلوكي، وليس مقياسًا للذكاء أو جودة البرمجة أو الرؤية. قارن الإصدار المعدل بالنموذج الأساسي باستخدام مجموعة اختبارات ثابتة. تشمل المراجع المفيدة تسعير GLM-5.3-Flash ودليل API لـ GLM-5.3-Flash.

التشغيل وواقع الأجهزة

320 مليار معامل لا تجعل النموذج مناسبًا للكمبيوتر المحمول، حتى مع وجود 18 مليارًا نشطًا. التنسيقات المتاحة تحدد مسار النشر:

  • Block-FP8: الإصدار المرجعي، ويستهدف وحدات معالجة الرسوميات في مراكز البيانات.
  • NVFP4: يبادل بعض الدقة بمساحة أقل على أجهزة NVIDIA، وهو المسار العملي لعقدة NVIDIA واحدة.
  • GGUF: يفتح مسار llama.cpp، وقد يناسب محطات العمل عالية الأداء بعد التكميم المناسب.
  • MLX: يستهدف Apple Silicon، لكنه يتطلب تكوينًا كبيرًا جدًا من الذاكرة الموحدة لهذا الحجم من النماذج.

للتشغيل المحلي، راجع تشغيل GLM-5.3-Flash محليًا. وللمقارنة الأوسع، راجع المسح الشامل لنماذج اللغة الكبيرة غير الخاضعة للرقابة، ونماذج اللغة الكبيرة بدون قيود، وإصدار DeepSeek R1 الذي أزيلت قيوده.

تنسيقات تشغيل النموذج

تقييم النموذج هو اختبار API

إذا كان هدفك بحثًا أمنيًا، أو تدريبًا لفريق أحمر وأزرق، أو تقييمًا دفاعيًا لفلاترك، فلا يكفي تشغيل موجه واحد وقراءة النتيجة. تعامل مع النموذج كنقطة نهاية API قابلة للاختبار:

  1. شغّل المجموعة نفسها ضد أهداف متعددة. قارن FP8 وNVFP4 وGGUF والنموذج الأساسي غير المعدل ونقطة نهاية مستضافة، مع تغيير عنوان URL الأساسي عبر متغيرات البيئة.
  2. استخدم تأكيدات آلية. معدل الرفض نسبة مئوية عبر مئات الموجهات، ولا يمكن قياسه بالقراءة اليدوية.
  3. أعد التشغيل دوريًا. الأوزان وإصدارات التكميم تتغير، لذلك تحتاج إلى اختبارات انحدار قابلة للتكرار الشهر المقبل.
  4. صمّم للتباين. الموجه نفسه قد ينتج إكمالًا مختلفًا. تحقّق من تصنيف الاستجابة أو خصائصها بدل مطابقة نص حرفي، واستخدم عددًا كافيًا من العينات.
  5. اختبر استدعاء الأدوات منفصلًا. إذا كان النموذج يستدعي وظائف، فتحقق من المخطط والعقد والسلوك عند رفض الأداة أو فشلها، لا من النص الناتج فقط.

في اختبار واجهة برمجة تطبيقات GLM-5.3-Flash باستخدام Apidog، يمكنك تعريف نقطة النهاية مرة واحدة، وحفظ مجموعة الموجهات، والتحقق من حقول الاستجابة، والتبديل بين الموفرين أو التنسيقات عبر متغيرات البيئة، ثم تشغيل المجموعة داخل CI. بهذه الطريقة تصبح النتائج قابلة للمقارنة بدل أن تكون حكاية من تشغيل واحد.

نزّل Apidog إذا كان تقييمك الحالي يعيش في دفتر ملاحظات لا يستطيع الآخرون إعادة تشغيله. وينطبق هذا النهج على أي نقطة نهاية متوافقة مع OpenAI. راجع أيضًا اختبار وكلاء الذكاء الاصطناعي غير الحتميين وموثوقية وكلاء الذكاء الاصطناعي في الإنتاج.

العمل الأحمر يحتاج إلى سجل تدقيق

تشغيل معايير الموجهات الضارة ضد نموذج غير خاضع للرقابة نشاط يحتاج إلى موافقة ونطاق واضحين وسجل قابل للمراجعة:

  • من شغّل الاختبار؟
  • ضد أي نقطة تحقق؟
  • بموافقة من؟
  • ضمن أي نطاق؟
  • ما النتائج والإجراءات اللاحقة؟

إذا كان كل ذلك موجودًا في سجل أوامر باحث واحد، فلا تملك برنامج بحث؛ بل تملك مسؤولية يصعب تفسيرها لاحقًا.

يمكن أن يناسب Sharkly هذا النوع من العمل:

  • لا تبدأ المهمة الحساسة من قائمة المهام إلا بعد تحديد نطاقها والموافقة عليها.
  • تصبح المهمة سجلًا للتقدم واستدعاءات الأدوات والنتائج، وليس مجرد حاوية للموجه.
  • يمكن أن يعمل وكيل قائد مع وكلاء وأشخاص ومراجعين آخرين.
  • يتيح نموذج «أحضر ما تملكه» توصيل جهاز محلي أو خادم أو حاوية تستخدم بيئة التشغيل المثبتة عليه.
  • بالنسبة إلى نموذج بحجم 320 مليار معامل، يوضح السجل أي صندوق GPU شغّل التقييم.
  • تتوفر بنية مألوفة للفرق: مساحات ومشاريع وسباقات ومهام، مع مزامنة Jira.

النموذج غير الخاضع للرقابة أداة بحث. واستخدام أدوات البحث دون سجل هو ما يجعل المؤسسات عاجزة عن شرح ما حدث.

الواقع القانوني والأمني

ترخيص MIT يحكم الأوزان، لكنه لا يمنح إذنًا لاستخدام المخرجات في أنشطة غير قانونية، ولا ينقل المسؤولية بعيدًا عنك. تظل القوانين المحلية وسياسة صاحب العمل وشروط المنصة التي تعمل ضمنها سارية، بغض النظر عن كون النموذج لم يرفض الطلب.

الاستخدامات المعقولة تشمل:

  • بحث الأمان وقابلية التفسير.
  • تدريب الفرق الحمراء والزرقاء.
  • دراسة آليات الرفض.
  • تقليل الرفض الزائد في مهام هندسة الأمان المشروعة.

إذا نشرت النموذج للمستخدمين النهائيين، تنتقل مسؤولية التصفية إلى نظامك أنت. وهذا قرار تصميمي يؤثر في التوظيف والمراقبة والاستجابة للحوادث، وليس مجرد خيار تكوين.

الأسئلة الشائعة

هل GLM-5.3-Flash-Uncensored هو النموذج نفسه؟

نعم من حيث البنية والأوزان الأساسية: 320 مليار معامل و18 مليارًا نشطًا، مع تعديل سلوك الرفض. راجع ما هو GLM-5.3-Flash.

هل تحققت جهة مستقلة من الأرقام؟

لا. كل الأرقام المذكورة أبلغت عنها OrcaRouter، ولم يتوفر تكرار من طرف ثالث عند كتابة المقال. المعايير عامة، ويمكن إعادة الاختبار إذا توفرت الأجهزة المناسبة.

أي تنسيق أختار؟

استخدم FP8 كمرجع للتقييم. اختر NVFP4 لعقدة NVIDIA واحدة، وGGUF لمحطات العمل التي تستخدم llama.cpp، وMLX لأجهزة Apple Silicon ذات الذاكرة الموحدة الكبيرة. لا تفترض تطابق السلوك بين التنسيقات؛ اختبرها بالمجموعة نفسها.

هل تؤثر إزالة القيود في الأداء العام؟

قد يحدث تدهور وفقًا للأعمال المنشورة حول هذه التقنية، لكن إعلاني OrcaRouter لم يقدما قياسًا لذلك في هذا النموذج. قارنه بالنموذج الأساسي بدل افتراض التكافؤ.

لماذا بقي الرفض بين 11% و18%؟

ترى OrcaRouter أن بعض المحاذاة لا يعتمد على اتجاه رفض خطي واحد. وقد يكون التفسير البديل أن التنفيذ لم يستخرج كل السلوك. لا تتعامل مع المعدل المتبقي كميزة أمان.

هل يمكن استخدامه تجاريًا؟

الأوزان مرخصة بترخيص MIT، لكن ذلك لا يمثل استشارة قانونية ولا يغطي سياسة منتجك أو متطلبات النشر. استشر فريقك القانوني، خصوصًا إذا وصلت المخرجات إلى المستخدمين النهائيين.

الخلاصة

إصداران لتنسيقات مختلفة خلال ثلاثة أيام، ومليونا مشاهدة للإصدار الأول، وكتالوج قائم من النماذج المعدلة: إزالة الرقابة نفسها لم تعد خبرًا جديدًا.

الجزء المهم هو النتيجة السلبية. التقنية التي تخفض الرفض بوضوح في نماذج مفتوحة أخرى خفضت GLM-5.3-Flash من 96% إلى 11% ثم توقفت. وإذا أكدت الاختبارات المستقلة هذا السلوك، فقد يقدم دليلًا حقيقيًا على كيفية تدريب Z.ai للنموذج، وهو أكثر قيمة من نقطة تحقق أخرى غير خاضعة للرقابة.

إذا قررت استخدامه، فابدأ بالأساسيات:

  • قِس السلوك بمجموعة طلبات قابلة للتكرار.
  • وجّه المجموعة نفسها إلى كل نقطة نهاية وتنسيق.
  • أعد الاختبار دوريًا وسجّل الإصدارات.
  • افصل اختبارات النص عن اختبارات استدعاء الأدوات.
  • احصل على موافقة واضحة وسجّل من شغّل ماذا وعلى أي أوزان.

النموذج غير الخاضع للرقابة لا يلغي الالتزام بمعرفة ما شغّلته؛ بل يزيد هذا الالتزام.

Top comments (0)