DEV Community

Cover image for تحليل معايير Qwen 3.8: ما تكشفه جداول علي بابا وما تخفيه
Yusuf Khalidd
Yusuf Khalidd

Posted on • Originally published at apidog.com

تحليل معايير Qwen 3.8: ما تكشفه جداول علي بابا وما تخفيه

لمدة أسبوعين، بقيت قصة Qwen 3.8 غير مكتملة: وعدت المراجعات الصحفية في يوليو بنموذج رائد، لكنها لم تنشر درجات معيارية. تغيّر ذلك في 3 أغسطس 2026، عندما نشرت Alibaba جدول معايير كاملًا لـ Qwen 3.8-Max مقابل Claude Opus 4.8 وFable 5 وGPT-5.6 Sol وسلفه Qwen3.7-Max، إضافةً إلى جدول مستقل للقدرات متعددة الوسائط مقابل Gemini 3.1 Pro وGPT-5.6 Sol. راجع منشور الإصدار الرسمي للتفاصيل الأصلية.

جرّب Apidog اليوم

الجدول يحتوي على مكاسب حقيقية، وخسائر واضحة، وتفاصيل منهجية مهمة. لكن لا تتعامل معه كحكم نهائي: اختبر النموذج على واجهة API وبمطالباتك الفعلية. إذا احتجت أولًا إلى المعاملات والتسعير وخيارات الوصول، ابدأ بـ شرح Qwen 3.8-Max.

ملاحظة: كل الدرجات أدناه منشورة من Alibaba نفسها، مع بيانات لوحة متصدرين تشير حواشيها إلى 3 أغسطس 2026. لم تكن التقييمات المستقلة متاحة وقت كتابة النص.

الجدول في لمحة

هذه أبرز نتائج معيار النص التي نشرتها Alibaba. الدرجة الأعلى أفضل في جميع الصفوف.

المعيار Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max
Terminal Bench 2.1 86.6 84.6 84.6 88.8 74.5
SWE-bench Pro 67.7 69.2 80.0 64.6 60.6
PaperBench 93.0 80.3 88.8 90.5 64.8
GPQA Diamond 92.6 92.0 92.6 94.1 92.4
IFBench 82.8 62.2 63.5 72.7 79.1
HLE (الاختبار الأخير للبشرية) 43.6 45.7 53.3 47.2 41.4

المصدر: جدول Alibaba المُعدّ من المورد. وتفصيل “المُعدّ من المورد” مهم جدًا عند تفسير النتائج.

حيث يتفوق Qwen 3.8-Max

PaperBench: أقوى نتيجة رئيسية

في PaperBench، الذي يختبر قدرة النموذج على استنساخ نتائج الأوراق البحثية، سجل Qwen 3.8-Max درجة 93.0:

  • GPT-5.6 Sol: 90.5
  • Fable 5: 88.8
  • Claude Opus 4.8: 80.3
  • Qwen3.7-Max: 64.8

التحسن مقارنةً بـ Qwen3.7-Max يبلغ 28.2 نقطة. هذه قفزة كبيرة تستحق التحقق المستقل، لكنها—إن تأكدت—تشير إلى قدرة قوية على البحث والمهام طويلة الأمد.

IFBench: اتباع تعليمات قوي

سجل Qwen 3.8-Max درجة 82.8 في IFBench، مقابل:

  • GPT-5.6 Sol: 72.7
  • Fable 5: 63.5
  • Claude Opus 4.8: 62.2
  • Qwen3.7-Max: 79.1

الفارق هنا بين 10 و20 نقطة عن المنافسين غير Qwen. كما أن Qwen3.7-Max كان قويًا أصلًا في هذا الصف، ما يوحي بأن اتباع التعليمات نقطة قوة مستمرة في السلسلة.

Terminal Bench 2.1: يتقدم على Claude بفارق محدود

في اختبار Alibaba لـ Terminal Bench 2.1، حقق Qwen 3.8-Max درجة 86.6، مقارنةً بـ 84.6 لكل من Opus 4.8 وFable 5.

لكن GPT-5.6 Sol يتصدر بدرجة 88.8، لذا فهي نتيجة مركز ثانٍ وليست فوزًا شاملًا. مع ذلك، التقدم بنقطتين على Claude في معيار طرفي عامل نتيجة عملية تستحق الاختبار على مهامك.

الأداء متعدد الوسائط

في الجدول متعدد الوسائط، تبدو نقاط القوة أوضح:

  • MathVision: 95.2
  • LogicVista: 91.9
  • OSWorld-Verified: 86.1
  • تفوق في معظم صفوف OCR وفق جدول Alibaba

لا يظهر Opus 4.8 أو Fable 5 مباشرة في هذه المقارنة متعددة الوسائط، لأن المقارنة تركز على Gemini 3.1 Pro وGPT-5.6 Sol. لذلك، اقرأ وصف “الاكتساح” في سياق النماذج والمهام المختارة في الجدول.

إذا كنت تقارن النموذج مع إصدار مفتوح الوزن آخر في الصيف نفسه، فالفارق متعدد الوسائط مهم أيضًا: Kimi K3 يعتمد على النص فقط. راجع مقارنتنا بين Qwen 3.8 وKimi K3.

حيث يخسر بوضوح

تركت Alibaba النتائج السلبية في جدولها، وهي خطوة مفيدة. أبرز نقاط الضعف هي التالية.

HLE: متأخر عن المنافسين

في Humanity’s Last Exam، سجل Qwen 3.8-Max 43.6:

  • Fable 5: 53.3
  • GPT-5.6 Sol: 47.2
  • Claude Opus 4.8: 45.7
  • Qwen3.7-Max: 41.4

هذه أدنى نتيجة بين النماذج الرائدة الأربعة في الجدول. التحسن مقارنةً بـ Qwen3.7-Max موجود، لكنه محدود.

SWE-bench Pro: فجوة كبيرة أمام Fable 5

في معيار هندسة البرمجيات الأصعب، سجل Qwen 3.8-Max 67.7:

  • Fable 5: 80.0
  • Claude Opus 4.8: 69.2
  • GPT-5.6 Sol: 64.6
  • Qwen3.7-Max: 60.6

التحسن الجيلي حقيقي، لكن النموذج ما زال متأخرًا بـ 12.3 نقطة عن Fable 5. لذلك، يمكن أن يكون الادعاءان صحيحين معًا:

  1. Qwen 3.8-Max يتفوق على Claude في Terminal Bench.
  2. Qwen 3.8-Max يتأخر بوضوح عن Fable 5 في SWE-bench Pro.

DeepSWE والمهام البرمجية الأعمق

وفق جدول Alibaba، يتأخر Qwen 3.8-Max أيضًا في DeepSWE. النمط العام في قسم البرمجة هو:

  • تنافسي في المهام العاملة المعتمدة على الطرفية.
  • أضعف في تقييمات هندسة البرمجيات الأعمق.

الخلاصة العملية

يبدو Qwen 3.8-Max قويًا في:

  • اتباع التعليمات.
  • استنساخ نتائج الأوراق البحثية.
  • الاستدلال البصري وذكاء المستندات.
  • بعض مهام الطرفية العاملة.

لكنه يتأخر في:

  • المعرفة الواسعة وفق HLE.
  • مهام هندسة البرمجيات العميقة.
  • SWE-bench Pro مقارنةً بـ Fable 5.

يذكر النص سعرًا قدره 2 دولار للإدخال و6 دولارات للإخراج لكل مليون رمز؛ راجع صفحة التسعير الرسمية.

كيف تقرأ جدول معايير المورد

لا تعني النتائج أن Alibaba غشّت. لكنها تعني أن جدول المورد ادعاء منهجي، وليس قياسًا مستقلًا. انتبه إلى هذه التفاصيل.

1. المورد اختبر نموذجه ومنافسيه

اختارت Alibaba إصدارات المعايير، واستراتيجيات التوجيه، وإعدادات أخذ العينات، وسياسات إعادة المحاولة. هذه قرارات طبيعية في تقييمات الإطلاق، لكنها قد تؤثر في النتيجة.

2. معظم صفوف البرمجة شُغلت عبر Claude Code

تشير التدوينة إلى أن معظم معايير البرمجة شُغلت باستخدام Claude Code، مع توجيهه إلى Qwen 3.8-Max عبر API متوافقة مع Anthropic.

هذا مفيد لأنه يضع النماذج في أداة موحدة، لكنه يعني أيضًا أن الدرجة تمثل فعليًا:

Qwen 3.8-Max داخل حزمة Claude Code
Enter fullscreen mode Exit fullscreen mode

قد يغير اختيار الحزمة نتائج الوكلاء بعدة نقاط. لذلك، إذا كنت ستستخدم SDK أو إطار عمل مختلفًا، اختبره مباشرة.

3. بعض المعايير داخلية لفريق Qwen

المعايير التالية بُنيت بواسطة فريق Qwen:

  • QwenSWEBench
  • QwenQoderBench
  • CoWorkBench
  • RecreationBench

المعايير الداخلية ليست عديمة القيمة، لكنها ليست من النوع نفسه الذي تمثله المعايير العامة مثل SWE-bench Pro. لا تقارنها كأنها متكافئة.

4. حاشية Fable 5

يتضمن جدول Alibaba ملاحظة بأن نتائج Fable 5 “قد تتضمن حالات تراجع”. هذا يعني أن عمود Fable 5 يجب قراءته بحذر إضافي، بغض النظر عن السبب التقني.

هذا النمط ليس خاصًا بـ Alibaba. تنشر Anthropic وOpenAI وGoogle جداولها الخاصة مع اختياراتها المنهجية أيضًا. يظهر النمط نفسه في تحليل معايير Kimi K3: جدول المورد مفيد، لكنه ليس بديلًا عن المصدر المستقل.

قائمة تحقق قبل الاعتماد على أي جدول

استخدم هذه القائمة عند تقييم جدول Alibaba أو أي جدول إطلاق آخر:

  1. من أجرى التقييم؟

    نتائج المورد عن نموذجه أو منافسيه تحتاج إلى تدقيق أكبر.

  2. ما الحزمة والإعدادات؟

    في المعايير العاملة، قد تغيّر الحزمة أو إعدادات أخذ العينات النتيجة.

  3. ما المعايير التي بناها المورد؟

    ميّز بوضوح بين التقييمات الداخلية والمعايير العامة.

  4. هل قرأت الحواشي؟

    الملاحظات الصغيرة قد تغيّر تفسير عمود كامل.

  5. ما الصفوف المفقودة؟

    قارن الجداول عبر الأجيال لمعرفة ما إذا كانت معايير معينة اختفت. راجع أداء الجيل السابق عبر الموردين.

  6. هل يوجد مصدر ثانٍ؟

    غالبًا ما يمنحك الانتظار لأسبوع واحد نتائج مستقلة أكثر فائدة.

نفّذ تقييمك الخاص عبر API

أفضل طريقة لتقليل الاعتماد على جداول الموردين هي اختبار النموذج على عبء عملك الحقيقي.

يتوفر Qwen 3.8-Max على Alibaba Cloud Model Studio بالمعرّف:

qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

وهو مدرج في صفحة النماذج الرسمية. يوفّر Model Studio واجهات متوافقة مع OpenAI وAnthropic.

إعداد اختبار عملي

أنشئ طلبين متطابقين:

  1. طلب إلى Qwen 3.8-Max.
  2. طلب إلى النموذج الذي تستخدمه حاليًا، مثل Qwen3.7-Max أو Kimi K3 أو Claude أو GPT.

احتفظ بـ 20 إلى 30 مطالبة من بيئة الإنتاج، ثم اختبر النماذج على السيناريو نفسه.

مثال طلب دردشة بأسلوب متوافق مع OpenAI:

{
  "model": "qwen3.8-max",
  "messages": [
    {
      "role": "user",
      "content": "حلل هذا السجل وحدد سبب الفشل وأعد JSON صالحًا."
    }
  ],
  "reasoning_effort": "xhigh"
}
Enter fullscreen mode Exit fullscreen mode

أضف تأكيدات قابلة للقياس

بدل تقييم الإجابة بالانطباع، تحقّق من خصائص واضحة، مثل:

  • الاستجابة JSON صالح.
  • الحقول المطلوبة موجودة.
  • لا توجد قيم فارغة في الحقول الحرجة.
  • زمن الاستجابة ضمن حدك المقبول.
  • حالة HTTP ناجحة.
  • النص لا يتجاوز حدًا معينًا.

مثال لتوقع بنية JSON:

{
  "status": "ok",
  "root_cause": "string",
  "recommendation": "string"
}
Enter fullscreen mode Exit fullscreen mode

قارن النتائج

باستخدام Apidog، أنشئ بيئتين لنقطتي النهاية، ثم شغّل سيناريو الاختبار نفسه على كلا النموذجين. قارن بين:

  • معدل النجاح.
  • زمن الاستجابة.
  • أخطاء التحليل أو البنية.
  • التكلفة عند إعدادات الاستدلال الفعلية.
  • جودة الإجابات في الحالات التي تهم منتجك.

ما الذي يجب اختباره تحديدًا مع Qwen؟

هناك نقطتان مهمتان:

  1. يضبط النموذج افتراضيًا:
   "reasoning_effort": "xhigh"
Enter fullscreen mode Exit fullscreen mode

لذلك قِس التكلفة وزمن الاستجابة عند مستوى الجهد الذي ستستخدمه فعلًا.

  1. إذا كنت ستستخدم API المتوافقة مع Anthropic، اختبرها منفصلة عن واجهة OpenAI-compatible. فقد استخدمت Alibaba هذا البروتوكول لمعظم معايير البرمجة الخاصة بها.

يمكنك تنزيل Apidog مجانًا، ربط نقاط النهاية كبيئات، والحصول على بيانات من عبء عملك قبل نشر نتائج لوحات المتصدرين المستقلة.

الأسئلة المتكررة

هل تم التحقق من أرقام معايير Qwen 3.8 بشكل مستقل؟

لا. اعتبارًا من 3 أغسطس 2026، جاءت الأرقام المنشورة من جدول Alibaba الخاص. لم تسجل Artificial Analysis ولوحات المتصدرين المجتمعية Qwen 3.8-Max بعد وقت كتابة النص. تعامل مع النتائج كادعاءات من المورد إلى أن تظهر تقييمات مستقلة.

ما أفضل نتيجة لـ Qwen 3.8-Max في المعايير؟

في الجدول الرئيسي، كانت أفضل نتيجة هي PaperBench بدرجة 93.0، متقدمًا على GPT-5.6 Sol وFable 5 وOpus 4.8. وفي الجدول متعدد الوسائط، تظهر MathVision بدرجة 95.2 وصفوف OCR ضمن أبرز النتائج.

أين يخسر Qwen 3.8-Max بوضوح؟

يخسر بوضوح في HLE، حيث سجل 43.6 مقابل 53.3 لـ Fable 5. كما سجل 67.7 في SWE-bench Pro مقابل 80.0 لـ Fable 5، ويتأخر أيضًا في DeepSWE.

ما مدى تحسن Qwen 3.8 عن Qwen 3.7-Max؟

وفق جدول Alibaba:

  • Terminal Bench 2.1: من 74.5 إلى 86.6.
  • SWE-bench Pro: من 60.6 إلى 67.7.
  • PaperBench: من 64.8 إلى 93.0.

لكن قرار الترقية يجب أن يعتمد على التسعير وزمن الاستجابة ومهامك الفعلية أيضًا. راجع مقارنتنا بين Qwen 3.8 وQwen 3.7.

Top comments (0)