معظم عمليات إطلاق النماذج تعرض قدرات البرمجة بالطريقة نفسها: درجة HumanEval ومقتطف يوضح كتابة بحث ثنائي. اتخذت Alibaba مسارًا مختلفًا مع Qwen 3.8-Max؛ فالادعاء ليس أنه يكتب وظائف جيدة، بل أنه يستطيع إدارة مشروع برمجي لأسابيع: فتح المشكلات، ودمج طلبات السحب، وشحن الميزات دون تدخل بشري.
تراجع هذه المقالة العروض التوضيحية الثلاثة للبرمجة التي نشرتها Alibaba عند الإطلاق، وأرقام المعايير التي تدعمها، ثم الجزء العملي: كيفية استخدام qwen3.8-max في Claude Code وCodex وQoder وQwen Code وOpenClaw، وكيفية اختبار واجهات API التي ينتجها الكود.
إذا كنت جديدًا على النموذج، فابدأ بقراءة ما هو Qwen 3.8: 2.4 تريليون معلمة إجمالية، و95 مليار معلمة نشطة، ونافذة سياقية بحجم مليون رمز، وأوزان مفتوحة موعودة للأسبوع التالي للإطلاق. سنركز هنا على البرمجة. المعلومات التالية تعكس الوضع حتى 3 أغسطس 2026.
ما تدعيه Alibaba بالفعل
يركز منشور إصدار Qwen 3.8 الرسمي على الاستقلالية بدلًا من مقتطفات الكود. تضع Alibaba نموذج Qwen 3.8-Max كنموذج يستطيع الحفاظ على مهمة هندسية طويلة الأفق: تخطيط العمل، وتنفيذه على مدى أيام، والتعافي من أخطائه، وتسليم نتيجة قابلة للمراجعة.
ثلاث نقاط تجعل الادعاء أكثر إثارة للاهتمام من تسويق الإطلاق المعتاد:
- العروض التوضيحية طويلة. ستة عشر يومًا تختلف جذريًا عن معيار وكيل مدته 20 دقيقة. على هذا المقياس، تصبح استعادة الأخطاء وإدارة السياق والانجراف عوامل حاسمة.
- أحد العروض التوضيحية عام. يمكنك تصفح المستودع وقراءة التعهدات والحكم على جودة الكود بنفسك.
- النظام المستخدم منافس. أجرت Alibaba معظم معايير البرمجة باستخدام Claude Code، ونشرت إعدادًا رسميًا يمكنك تشغيله بنفسك.
تحذير: جميع الأرقام هنا تأتي من مواد إطلاق Alibaba. لم يكن هناك تحقق مستقل حتى أوائل أغسطس 2026، لذا تعامل مع هذه العروض كعروض توضيحية وليست تدقيقات مستقلة.
العروض التوضيحية الثلاثة للبرمجة
oh-my-cli: 16 يومًا من التطوير المستقل
العرض الرئيسي هو تشغيل Qwen 3.8-Max لبناء أداة سطر أوامر وتركه يعمل دون مراقبة. حتى 30 يوليو، استمرت العملية 16 يومًا وأنتجت:
- 265 تعهدًا
- 127 طلب سحب
- 151 مشكلة
وفقًا لـ Alibaba، فتح النموذج هذه العناصر وعمل عليها وأغلقها بنفسه.
المستودع عام على qwen-code-dev-bot/oh-my-cli، وهذه أهم نقطة عملية في العرض. لا تكتفِ بعدد التعهدات؛ راجع المستودع بنفسك:
- هل تصلح طلبات السحب المشكلات التي تشير إليها؟
- هل ينشئ النموذج مهامًا مصطنعة ليغلقها؟
- كيف يتعامل مع التراجعات والأخطاء التي تسبب بها؟
- هل الاختبارات والتوثيق وتغييرات الكود متسقة؟
هذه الأنماط تكشف عن موثوقية العمل طويل الأمد أكثر مما تكشفه درجة معيار واحدة.
تشغيل استنساخ الأبحاث: كود بحثي وليس كود تطبيق
استهدف العرض الثاني مهمة أصعب: استنساخ ورقة بحثية في تعلم الآلة من الصفر. وفقًا لأرقام Alibaba، استغرقت العملية نحو 125 ساعة، وأنتجت نحو 7,600 سطر من الكود، ونفذت 33 جولة تدريب على GPU.
النتيجة المعلنة هي استنساخ 6 نتائج من الورقة، ثم تجاوز النتيجة المبلغ عنها بـ 2.7 نقطة على AIME24.
استنساخ الأبحاث يختبر قدرات تختلف عن الإكمال التلقائي: إعداد البيئات، واكتشاف المعلمات الفائقة غير الواضحة، وتشخيص الأخطاء الصامتة، وإدارة دورات تدريب طويلة. يتوافق هذا العرض مع أقوى معيار لـ Qwen 3.8-Max: PaperBench.
مسابقة Tianchi: 24 ساعة ضد فرق بشرية
وضع العرض الثالث النموذج في مسابقة حية لعلوم البيانات على منصة Tianchi التابعة لـ Alibaba، بحد أقصى 24 ساعة. قدم النموذج 45 مشاركة، وكرر نهجه بناءً على نتيجة كل محاولة، ووصل إلى دقة نهائية قدرها 0.853.
وضعت هذه النتيجة النموذج أمام 458 من أصل 526 فريقًا بشريًا مشاركًا.
النموذج لم يفز، لكنه تفوق على 87% من المشاركين. هذا يوضح قدرة مفيدة عمليًا: التكرار السريع تحت ضغط الوقت، حيث تصبح نتيجة كل إرسال مدخلًا للمحاولة التالية.
تحذير إضافي: Tianchi منصة تابعة لـ Alibaba. العرض حقيقي، لكن المورد يتحكم في بيئة التنفيذ.
معايير البرمجة وراء العروض التوضيحية
نشرت Alibaba جدول معايير كاملًا عند الإطلاق. فيما يلي الصفوف المرتبطة بالبرمجة؛ جميع الأرقام نتائج تشغيل Alibaba نفسها.
| المعيار | Qwen 3.8-Max | أفضل منافس وفق جدول Alibaba |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 — GPT-5.6 Sol |
| SWE-bench Pro | 67.7 | 80.0 — Fable 5 |
| PaperBench | 93.0 | 90.5 — GPT-5.6 Sol |
النقاط العملية من الجدول:
Terminal Bench 2.1: 86.6
تضع هذه النتيجة Qwen 3.8-Max أمام Claude Opus 4.8 وFable 5، وكلاهما سجّل84.6في جدول Alibaba. هذا هو المعيار الأقرب إلى سيناريوهات العمل عبر الطرفية والوكلاء، ويدعم عرضoh-my-cli.SWE-bench Pro: 67.7
هنا يتأخر النموذج بوضوح عن Fable 5 الذي سجّل80.0. إذا كانت مهمتك الأساسية هي إصلاح مشكلات ضمن مستودع قائم، فلا تتعامل مع Qwen 3.8-Max باعتباره المتصدر وفق هذه الأرقام.PaperBench: 93.0
هذه أفضل نتيجة رئيسية للنموذج في الجدول، وتدعم عرض استنساخ الأوراق البحثية مباشرة.
هناك تفصيل مهم: أجرت Alibaba معظم هذه المعايير على Claude Code، بما في ذلك عمليات تشغيل النماذج المنافسة. وتشير حواشي الجدول إلى أن نتائج Fable 5 قد تتضمن عمليات احتياطية. اختيار النظام يؤثر في نتائج معايير الوكلاء، لذا اعتبر هذا الجدول نقطة بيانات، لا حكمًا نهائيًا.
في المقابل، يعني ذلك أيضًا أن Alibaba حسّنت النموذج لنظام قد تستخدمه فعلًا، ونشرت إعدادًا له.
كيفية البرمجة باستخدام Qwen 3.8 اليوم
يتوفر Qwen 3.8-Max على Alibaba Cloud Model Studio. تحتاج إلى مفتاح DashScope API من home.qwencloud.com.
وفق صفحة تسعير Model Studio الرسمية، السعر هو:
- 2 دولار لكل مليون رمز إدخال
- 6 دولارات لكل مليون رمز إخراج
- سعر ثابت حتى سياق مليون رمز
Claude Code
يوفر النموذج نقطة نهاية متوافقة مع Anthropic. اضبط متغيرات البيئة التالية قبل تشغيل Claude Code:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
ثم شغّل Claude Code كالمعتاد. ستتجه الطلبات إلى Qwen 3.8-Max بدلًا من Claude.
هذا هو الإعداد الأقرب إلى البيئة التي استخدمتها Alibaba في معظم معايير البرمجة، لذا ابدأ به عند إجراء تقييم داخلي.
Codex
أضف موفر النموذج إلى إعدادات Codex:
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
ثم عيّن مفتاح API:
export DASHSCOPE_API_KEY=your-dashscope-api-key
يستخدم هذا الإعداد نقطة النهاية المتوافقة مع OpenAI بدل نقطة Anthropic، مع النموذج والمفتاح نفسيهما.
Qoder وQwen Code وOpenClaw
الإعدادات الأساسية للأدوات الأخرى:
-
Qoder CLI: اختر
qwen3.8-maxكنموذج. التكامل من الطرف الأول، لذا يكون الإعداد عبر قيمة تكوين. -
Qwen Code: عيّن
DASHSCOPE_API_KEYواختر النموذج. إذا كنت تستخدم Qwen Code مع نماذج Qwen البرمجية السابقة، فلا تحتاج عادةً إلى تغيير آخر. -
OpenClaw: يحدد الإعداد الرسمي معرف النموذج ويضبط
maxTokensعلى65536، وهو الحد الأقصى لطول الإخراج المذكور للنموذج.
ارجع إلى منشور الإطلاق للحصول على أحدث صيغة إعداد لكل أداة، بدل الاعتماد على لقطة إعدادات قديمة.
حدد جهد التفكير عمدًا
يدعم Qwen 3.8-Max المعلمة reasoning_effort بثلاثة مستويات:
-
xhigh— الافتراضي mediumlow
استخدمها بحسب المهمة:
| نوع المهمة | الإعداد المقترح |
|---|---|
| إعادة هيكلة متعددة الملفات | xhigh |
| تصحيح أخطاء طويل ومعقد | xhigh |
| تخطيط وتنفيذ مهام وكيل | xhigh |
| إعادة تسمية رموز | low |
| إضافة أو تحديث docstrings | low |
| تغييرات ميكانيكية متكررة | low |
تُحاسب رموز التفكير كرموز إخراج، أي بسعر 6 دولارات لكل مليون رمز. استخدم xhigh عندما تحتاج فعلًا إلى تخطيط واستدلال عميق، ولا تستخدمه تلقائيًا لتعديلات بسيطة.
إذا كان Qwen 3.8-Max أكبر من احتياجات المهمة، فخط Qwen3 Coder السابق ما زال متاحًا للأعمال البرمجية المخصصة، بينما يغطي Qwen3 Coder Flash المهام الأسرع والأقل كلفة. وللمقارنة مع نموذج آخر ذي أوزان مفتوحة، راجع كيف يتعامل Kimi K3 مع أعمال البرمجة.
اختبار ما يبنيه النموذج: خطوة Apidog
توجد فجوة في عروض البرمجة المستقلة: قد يكتب النموذج كودًا يتصل بواجهات API، لكن ذلك لا يضمن صحة هذه الاتصالات. يمكن أن ينجح البناء والاختبار المحلي بينما يظل الكود:
- يستدعي نقطة نهاية خاطئة
- يتعامل مع أخطاء
429بشكل غير صحيح - يرسل جسم طلب لا يجتاز التحقق في الإنتاج
- يفترض شكل استجابة مختلفًا عن الشكل الفعلي
اتبع عادتين عمليتين لتقليل هذه المخاطر.
1. اختبر نقاط النهاية التي يستدعيها الكود المولّد
عندما ينشئ Qwen 3.8-Max خدمة أو عميل API، استورد المواصفة ذات الصلة إلى Apidog واختبر نقاط النهاية مباشرة:
- اختبر تدفقات المصادقة.
- أرسل استجابات أخطاء متوقعة وغير متوقعة.
- اختبر حمولات الحالات الهامشية.
- تحقق من سلوك إعادة المحاولة وحدود المعدل.
- قارن الطلبات الفعلية بالمواصفة.
اكتشاف افتراض خاطئ في تشغيل اختباري أرخص من تتبع أثر خطأ بعد يومين من جلسة وكيل مستقلة.
إذا كنت تقيّم API الخاصة بالنموذج قبل الالتزام بها، يشرح دليل Qwen 3.8 API إعداد بروتوكولي OpenAI وAnthropic. يمكنك استخدام Apidog لفحص أشكال البروتوكولين جنبًا إلى جنب، بما في ذلك الاستجابات المتدفقة وفروق التفكير.
2. حاكِ واجهات API قبل تشغيل الوكلاء على الإنتاج
كلما طالت مدة تشغيل الوكيل، زادت أهمية المحاكاة. تشغيل مستقل لمدة 16 يومًا ضد بنية إنتاجية حية قد يسبب:
- تجاوز حدود معدل الطلبات
- تعديل بيانات حقيقية
- فواتير غير متوقعة
- آثارًا جانبية يصعب عكسها
تمنح خوادم المحاكاة في Apidog الوكيل استجابات واقعية دون لمس الأنظمة الحقيقية.
استخدم هذا النمط:
- أنشئ أو استورد مواصفة API.
- أضف استجابات محاكاة للحالات الناجحة وحالات الخطأ.
- وجّه متغير
BASE_URLفي الكود المولّد إلى خادم المحاكاة. - شغّل الوكيل واختبر مخرجاته ضمن بيئة معزولة.
- راجع التغييرات بشريًا.
- استبدل عنوان المحاكاة بعنوان الإنتاج فقط بعد الموافقة.
يمكنك تنزيل Apidog مجانًا لإعداد محاكاة خلال دقائق.
القاعدة العامة بسيطة: كلما منحت نموذج البرمجة استقلالية أكبر، أصبحت طبقة API سطح التحكم الأساسي لديك. قد لا تستطيع مراجعة كل تعهد لحظيًا، لكن يمكنك التحكم في الأنظمة التي يُسمح للكود بالاتصال بها.
الأسئلة الشائعة
هل Qwen 3.8 جيد للبرمجة؟
وفق أرقام Alibaba، النموذج قوي في البرمجة الوكائية والبحثية:
- Terminal Bench 2.1:
86.6 - PaperBench:
93.0
لكنه متوسط الأداء نسبيًا في إصلاح الأخطاء على مستوى المستودع:
- SWE-bench Pro:
67.7 - Fable 5 على المعيار نفسه:
80.0
هذه نتائج يديرها المورد دون تحقق مستقل حتى الآن. القراءة العملية: النموذج واعد للعمل المستقل طويل الأمد، لكنه ليس المتصدر وفق جدول Alibaba في إصلاح المشكلات التقليدية ضمن مستودعات قائمة.
هل يمكنني استخدام Qwen 3.8 في Claude Code؟
نعم. اضبط القيم التالية:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
نشرت Alibaba هذا الإعداد، وأجرت معظم معايير البرمجة على Claude Code.
كم تكلف البرمجة باستخدام Qwen 3.8؟
السعر المعلن هو:
- 2 دولار لكل مليون رمز إدخال
- 6 دولارات لكل مليون رمز إخراج
يشمل ذلك سياقًا يصل إلى مليون رمز بسعر ثابت. تُحسب رموز التفكير كرموز إخراج، والإعداد الافتراضي xhigh قد يزيد الاستهلاك بوضوح في الجلسات الوكائية الطويلة.
للمزيد من المقارنات وحسابات التكلفة، راجع تفصيل معايير Qwen 3.8.
هل كان تشغيل oh-my-cli لمدة 16 يومًا مستقلًا فعلًا؟
هذا ادعاء Alibaba. لكن بخلاف معظم عروض الموردين، يمكنك فحص الأثر الناتج بنفسك: مستودع qwen-code-dev-bot/oh-my-cli عام ويحتوي، حتى 30 يوليو 2026، على 265 تعهدًا و127 طلب سحب و151 مشكلة.
يبقى الحكم على الجودة بيدك: اقرأ طلبات السحب، راجع الاختبارات، وتحقق مما إذا كانت التغييرات تحل مشكلات حقيقية.



Top comments (0)