DEV Community

Cover image for مقاييس أداء كلود أوبوس 5: ماذا تكشف الأرقام؟
Yusuf Khalidd
Yusuf Khalidd

Posted on • Originally published at apidog.com

مقاييس أداء كلود أوبوس 5: ماذا تكشف الأرقام؟

أطلقت Anthropic نموذج Claude Opus 5 في 24 يوليو 2026 مع ادعاءات قوية حول المعايير: أكثر من ضعف نتيجة Opus 4.8 في تقييم واحد، وحوالي ثلاثة أضعاف أفضل نموذج تالٍ في تقييم آخر، وتفوق على Fable 5 بتكلفة أقل في تقييم ثالث. هذه الادعاءات لا تعني بالضرورة أنها غير صحيحة، لكنها تتطلب القراءة بالطريقة نفسها التي تقرأ بها أي عرض إطلاق من مزود: راجع ما تم قياسه، والتكوين المستخدم، وما لم يتم نشره. يجمع هذا الدليل ادعاءات Anthropic المنشورة، ويشرح حدودها، ثم يوضح كيف تبني تقييماً قابلاً للتكرار لحمل عملك باستخدام Apidog.

جرّب Apidog اليوم

بالنسبة إلى النموذج نفسه — claude-opus-5 بسياق مليون رمز، وإخراج أقصى يبلغ 128 ألف رمز، وقطع معرفة في مايو 2026 — ابدأ بـما هو Claude Opus 5. المصدر الأساسي للأرقام التالية هو منشور إطلاق Claude Opus 5 من Anthropic.

كل ادعاء منشور في جدول واحد

يعرض الجدول التالي مجموعة بيانات المقارنة المعيارية التي قدمتها Anthropic عند الإطلاق. انتبه إلى عمود المقارنة: كثير من الادعاءات نُشرت كنسب مقارنةً بنموذج آخر، لا كدرجات خام قابلة للتحقق.

المعيار ادعاء Anthropic صيغة التعبير مقارنة بـ
Frontier-Bench v0.1 يتفوق على جميع النماذج الأخرى؛ أكثر من ضعف نتيجة Opus 4.8، بتكلفة أقل لكل مهمة نسبة + ادعاء تكلفة Opus 4.8 والمجال
ARC-AGI 3 حوالي 3 أضعاف نتيجة أفضل نموذج تالٍ نسبة أفضل نموذج تالٍ غير مسمى
OSWorld 2.0 يتفوق على Fable 5 بثلث التكلفة ترتيب + ادعاء تكلفة Fable 5
CursorBench 3.2 في حدود 0.5% من ذروة Fable 5، بنصف السعر فجوة + ادعاء تكلفة Fable 5
Zapier AutomationBench معدل نجاح يقارب 1.5 ضعف أفضل نموذج تالٍ نسبة أفضل نموذج تالٍ غير مسمى
الكيمياء العضوية +10.2 نقطة فوق Opus 4.8 فرق مطلق Opus 4.8
تحليل البروتين +7.7 نقطة فوق Opus 4.8 فرق مطلق Opus 4.8
استغلال الأمن السيبراني متخلف عن Mythos 5 ترتيب Mythos 5
البحث البيولوجي المستقل متخلف عن Mythos 5 ترتيب Mythos 5

مصدر هذه البيانات هو منشور إطلاق Anthropic ووثائق النموذج. وقت كتابة هذا التقرير، لم ينشر طرف ثالث إعادة إنتاج مستقلة لأي من النتائج.

ملخص ادعاءات معايير Claude Opus 5

هناك ملاحظتان عمليتان قبل استخدام هذه الأرقام في قرار ترحيل:

  1. صفان فقط من أصل تسعة يعرضان فرقاً مطلقاً بالنقاط.
  2. Anthropic تعرض بنفسها مجالين يتفوق فيهما Mythos 5 على Opus 5.

مشكلة النسب: ما الذي لا تخبرك به؟

أربعة من الادعاءات — Frontier-Bench وARC-AGI 3 وAutomationBench وجزئياً CursorBench — تستخدم نسباً أو فجوات بدلاً من درجات خام. هذا ليس تفصيلاً شكلياً؛ بل يغير تفسير النتيجة.

النسبة تخفي المقام

ادعاء «حوالي 3 أضعاف أفضل نموذج تالٍ» على ARC-AGI 3 لا يحدد النتيجة الفعلية:

  • إذا كانت نتيجة النموذج التالي 8%، فإن ثلاثة أضعاف تعني 24%.
  • إذا كانت نتيجته 25%، فإن ثلاثة أضعاف تعني 75%.

كلا السيناريوهين يطابقان العبارة المنشورة، لكن أثرهما العملي مختلف تماماً. لم تنشر Anthropic المقام أو الدرجة الخام.

المضاعفة أسهل في الطرف الأدنى من المقياس

ينطبق الأمر نفسه على عبارة «أكثر من ضعف نتيجة Opus 4.8» في Frontier-Bench v0.1. إذا كانت نقطة البداية منخفضة جداً، فقد تبدو القفزة النسبية كبيرة مع تحسن مطلق محدود. كما أن v0.1 يشير إلى معيار جديد لا يملك بعد سجل تتبع منشوراً أو إعادة إنتاج من المجتمع.

«أفضل نموذج تالٍ» ليس اسماً كافياً

في ARC-AGI 3 وAutomationBench، لا تسمي Anthropic النموذج المنافس. قد يكون Fable 5 أو Mythos 5 أو نموذجاً من مختبر آخر. دون معرفة خط الأساس، لا يمكنك وضع النسبة في سياقها التنافسي الصحيح.

الفجوة تحتاج إلى وحدة قياس

عبارة «في حدود 0.5% من ذروة Fable 5» في CursorBench 3.2 تترك سؤالين مهمين:

  • هل المقصود 0.5 نقطة مئوية أم فرق نسبي قدره 0.5%؟
  • ماذا تعني «الذروة»؟ هل هي أفضل تكوين للاختبار أم الإعداد الافتراضي؟

هذه التفاصيل تؤثر مباشرة في قرارك، خصوصاً في مهام البرمجة التي قد تختلف فيها النتائج حسب إعداد effort. راجع تحليل معايير Fable 5 لفهم كيفية قراءة هذه المقارنات.

في المقابل، الادعاءان العلميان أوضح:

  • +10.2 نقطة في الكيمياء العضوية مقارنةً بـ Opus 4.8.
  • +7.7 نقطة في تحليل البروتين مقارنةً بـ Opus 4.8.

لا تزال الدرجة الأساسية غير منشورة، لكن حجم التحسن المطلق واضح.

افصل سعر الرمز عن تكلفة المهمة

تجمع ثلاثة ادعاءات بين الأداء والتكلفة:

  • تكلفة أقل لكل مهمة في Frontier-Bench.
  • ثلث التكلفة في OSWorld 2.0.
  • نصف السعر في CursorBench 3.2.

يمكن التحقق من سعر الرمز المنشور: يكلف Opus 5 مبلغ 5 دولارات لكل مليون رمز إدخال و25 دولاراً لكل مليون رمز إخراج. هذا مطابق لـ Opus 4.8 ويعادل نصف تسعير Fable 5 المنشور، وهو 10 دولارات للإدخال و50 دولاراً للإخراج. هذه بيانات منشورة في صفحة التسعير، وليست نتيجة معيارية.

لتحليل عناصر التكلفة الأخرى، مثل التخزين المؤقت والدفعات والوضع السريع، راجع تحليل تسعير Opus 5.

لكن تكلفة المهمة ليست تكلفة الرمز فقط. احسبها بهذه الصيغة:

تكلفة المهمة = تكلفة الإدخال + تكلفة الإخراج + تكلفة التخزين المؤقت + تكلفة دورات الوكيل
Enter fullscreen mode Exit fullscreen mode

وتتغير النتيجة بناءً على:

  • قيمة output_config.effort
  • تفعيل أو تعطيل التفكير
  • عدد دورات الحلقة الوكيلية
  • عدد الوكلاء الفرعيين
  • طول المخرجات
  • إعادة استخدام السياق والتخزين المؤقت

تشير إرشادات Anthropic إلى أن Opus 5 قد ينتج استجابات افتراضية أطول من Opus 4.8، وقد يفوض مهاماً إلى وكلاء فرعيين بسهولة أكبر. لذلك، لا تفترض أن فرق سعر الرمز سيظهر تلقائياً كفرق مماثل في تكلفة حمل عملك.

عوامل تكلفة Claude Opus 5 لكل مهمة

لا يجعل ذلك ادعاءات التكلفة خاطئة. نصف السعر المنشور يظل نصف السعر المنشور، وتوضح مقارنة Opus 5 وFable 5 الحالات التي يمكن أن تظهر فيها هذه الفجوة فعلياً. لكن تكلفة المهمة تعتمد على التكوين، لذا يجب قياسها في بيئتك.

السقف الذي تعترف به Anthropic

أحد أكثر أسطر الإطلاق فائدة ليس ادعاء فوز. تذكر Anthropic أن Opus 5 لا يزال متخلفاً عن Mythos 5 في:

  • استغلال الأمن السيبراني
  • البحث البيولوجي المستقل

كما يحتفظ Fable 5 بلقب «النموذج الأكثر قدرة الذي تم إصداره على نطاق واسع».

موضع Claude Opus 5 مقارنةً بـ Fable 5 وMythos 5

الاستنتاج العملي ليس أن Opus 5 ضعيف، بل أن موضعه مختلف: قدرة على مستوى الحدود بسعر أقل من Fable 5، مع وجود سقف معلن فوقه في فئات معينة.

للمهام المتخصصة في أبحاث الأمن أو العمل العلمي المستقل، راجع شرح نموذج فئة Mythos ومقارنة Fable 5 وMythos 5.

هناك أيضاً تفصيل تشغيلي مهم: توفر Anthropic خيار:

{
  "fallbacks": "default"
}
Enter fullscreen mode Exit fullscreen mode

وهو متاح خلف ترويسة الإصدار التجريبي:

server-side-fallback-2026-07-01
Enter fullscreen mode Exit fullscreen mode

يتيح هذا الخيار الرجوع تلقائياً إلى Opus 4.8 عندما يرفض Opus 5 طلباً متعلقاً بفئة الأمن السيبراني. إذا كان منتجك يتعامل مع هذه الفئة من الطلبات، اختبر هذا المسار كجزء من التقييم، لا كإعداد افتراضي غير متحقق منه.

ما لا تقيسه معايير الإطلاق

المعايير تقيس إنجاز المهام ضمن إعداد محدد، لكنها لا تقيس بالضرورة ما يحدث عند تشغيل النموذج داخل منتجك.

1. الانجراف السلوكي عند الترحيل

يتحقق Opus 5 من عمله ذاتياً دون مطالبة صريحة. إذا كانت مطالباتك الموروثة من Opus 4.8 تتضمن تعليمات مثل «راجع إجابتك مرة أخرى»، فقد تحصل على تحقق زائد واستهلاك رموز أعلى.

توصي إرشادات المطالبة لـ Opus 5 بمراجعة هذه التعليمات.

2. طول الإخراج

قد تكون الاستجابات والمخرجات المكتوبة أطول مما كانت عليه في Opus 4.8. تقليل الجهد يمكن أن يقلل رموز التفكير، لكنه لا يضمن تقليل طول الإجابة المرئية.

استخدم تعليمات صريحة مثل:

أعطِ الإجابة النهائية فقط.
لا تشرح خطوات التفكير.
استخدم 5 نقاط كحد أقصى.
Enter fullscreen mode Exit fullscreen mode

3. سلوك الأدوات عند تعطيل التفكير

عند استخدام:

{
  "thinking": {
    "type": "disabled"
  }
}
Enter fullscreen mode Exit fullscreen mode

قد تظهر استدعاءات الأدوات أحياناً كنص عادي بدلاً من استدعاءات منظمة قابلة للتنفيذ. في حلقة وكيلية، يمكن أن يؤدي ذلك إلى دورات لاحقة غير صحيحة.

لذلك، لا تختبر نتيجة النص فقط. تحقق من بنية استدعاءات الأدوات فعلياً.

4. إعادة معايرة effort

تمت إعادة معايرة مستويات الجهد في Opus 5. لا تنقل إعدادات Opus 4.8 مباشرةً؛ نفذ مسحاً جديداً لقيم:

low
medium
high
xhigh
Enter fullscreen mode Exit fullscreen mode

راجع دليل معلمة الجهد قبل اعتماد قيمة إنتاجية.

5. قيود التكوين التي تؤدي إلى خطأ 400

الجمع بين:

{
  "thinking": {
    "type": "disabled"
  },
  "output_config": {
    "effort": "xhigh"
  }
}
Enter fullscreen mode Exit fullscreen mode

أو استخدام max مع تعطيل التفكير يعيد خطأ 400. هذه ليست مشكلة قدرة، لكنها قد تعطل الترحيل إذا كانت إعداداتك مبنية ديناميكياً.

راجع دليل ترحيل Opus 4.8 إلى Opus 5 قبل التبديل في الإنتاج.

خطة تقييم عملية لحمل عملك

بدلاً من اتخاذ قرار الترحيل من أرقام الإطلاق، نفذ تقييماً صغيراً يمكن إكماله خلال فترة ما بعد الظهر.

1. أنشئ مجموعة مهام حقيقية

اجمع بين 20 و50 مهمة من تاريخك الفعلي:

  • تذاكر مغلقة
  • طلبات سحب مدمجة
  • حالات دعم
  • أخطاء إنتاج تم حلها
  • مهام أدوات داخلية

استخدم بيانات واقعية بعد إزالة الأسرار والبيانات الحساسة. المدخلات الحقيقية تكشف الغموض والتنسيق والحالات الهامشية التي لا تظهر في المطالبات الاصطناعية.

2. ثبّت التكوين

سجل كل حقل مؤثر في النتيجة:

{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "output_config": {
    "effort": "medium"
  }
}
Enter fullscreen mode Exit fullscreen mode

وسجل أيضاً:

  • حالة التفكير
  • الأدوات المتاحة
  • إعدادات التخزين المؤقت
  • عدد المحاولات
  • حد الدورات الوكيلية
  • إصدار نظام التقييم

من دون تكوين ثابت، لا يمكنك تفسير الفروق.

3. قس تكلفة المهمة التي تم حلها

لا تعتمد على تكلفة الرمز وحدها. لكل مهمة، سجل حقول usage من الاستجابة، ثم احسب:

تكلفة المهمة التي تم حلها =
إجمالي التكلفة / عدد المهام التي اجتازت فحص القبول
Enter fullscreen mode Exit fullscreen mode

إذا فشل النموذج في نصف المهام لكنه استهلك رموزاً أقل، فتكلفة الرمز المنخفضة لا تعني بالضرورة كفاءة أعلى.

4. نفذ مسحاً لمستويات الجهد

شغّل مجموعة المهام نفسها على:

low
medium
high
xhigh
Enter fullscreen mode Exit fullscreen mode

أنشئ جدولاً داخلياً مثل:

مستوى الجهد معدل النجاح متوسط الرموز متوسط التكلفة متوسط زمن التنفيذ
low
medium
high
xhigh

قد تجد أن low أو medium يحققان معدل نجاح مماثلاً لحمل عملك بكلفة أقل.

5. اختبر الحلقة الوكيلية كاملةً

معايير مثل OSWorld وCursorBench وAutomationBench تتضمن سلوكاً وكيلياً متعدد الدورات. لا يكفي اختبار مطالبة واحدة ثم مقارنة النص النهائي.

سجل على الأقل:

  • عدد دورات الوكيل
  • عدد استدعاءات الأدوات
  • نسبة استدعاءات الأدوات الصحيحة
  • نسبة المهام المكتملة
  • نسبة الحلقات المتوقفة أو المتكررة
  • استهلاك الرموز لكل دورة

6. قارن بالنظام الذي تستخدمه اليوم

شغّل النموذج الحالي — سواء كان Opus 4.8 أو Sonnet 5 أو غيره — ضمن مجموعة المهام والتكوين نفسه قدر الإمكان.

المقارنة المفيدة هي:

Opus 5 على بياناتك مقابل نموذجك الحالي على بياناتك
Enter fullscreen mode Exit fullscreen mode

وليست مقارنة درجة إطلاق عامة مع منتجك.

7. سجل الرفضات منفصلةً عن الإخفاقات

بالنسبة إلى المهام المتعلقة بالأمن السيبراني، افصل الحالات التالية:

  • نجاح
  • فشل تقني
  • إجابة غير صحيحة
  • رفض سياسة
  • رجوع ناجح إلى Opus 4.8
  • رجوع فاشل

ستحتاج هذه البيانات قبل اتخاذ قرار حول استخدام ترويسة الرجوع.

لمنهجية مقارنة مشابهة، راجع مقالة معايير Sonnet 5 ودليل API الخاص بـ Opus 5.

تشغيل التقييم في Apidog

التقييم السابق عبارة عن مجموعة منظمة من طلبات HTTP: ترويسات مصادقة، أجسام JSON، استجابات متدفقة، واستجابات usage تحتاج إلى التقاطها في كل تشغيل. يمكنك تنفيذ هذه العملية في Apidog مع بيئات ومتغيرات وتأكيدات قابلة لإعادة الاستخدام.

إعداد تقييم Claude Opus 5 في Apidog

إعداد عملي

  1. أنشئ طلباً إلى نقطة نهاية Anthropic Messages.
  2. خزّن مفتاح API في متغير بيئة مثل ANTHROPIC_API_KEY، ولا تضعه في جسم الطلب.
  3. انسخ الطلب لكل مستوى effort تريد اختباره.
  4. استخدم التدفق عندما تحتاج إلى فحص أحداث SSE.
  5. تحقق من أن استدعاءات الأدوات منظمة فعلياً وليست نصاً عادياً.
  6. أضف تأكيدات لحقول usage.
  7. احفظ الطلبات في مجموعة واحدة لتبديل معرف النموذج لاحقاً دون إعادة بناء التقييم.

هذا طلب أساسي يمكن استيراده أو محاكاته داخل Apidog:

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 8192,
    "output_config": {
      "effort": "medium"
    },
    "messages": [
      {
        "role": "user",
        "content": "Fix the failing test in this diff."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

غيّر حقلاً واحداً فقط في كل تشغيل، واترك بقية التكوين ثابتاً. بعد كل استجابة، سجّل:

{
  "usage": {
    "input_tokens": 0,
    "output_tokens": 0
  }
}
Enter fullscreen mode Exit fullscreen mode

وأضف حقول التخزين المؤقت إذا كانت موجودة في الاستجابة. بهذه الطريقة تحصل على بيانات قابلة للمقارنة بدلاً من تقدير بصري للاستهلاك.

يمكنك تنزيل Apidog لإعداد البيئات والمتغيرات والتأكيدات ضمن مجموعة تقييم واحدة.

الملخص الصادق

قصة معايير Opus 5 قوية وفقاً لما أعلنته Anthropic: تحسن كبير مقارنةً بـ Opus 4.8، وتسعير قائمة لم يتغير، وادعاءات تنافسية في عدة معايير. لكن البيانات مدارة من البائع، ولم تكن قد أُعيد إنتاجها بشكل مستقل حتى 25 يوليو 2026، كما أن كثيراً من النتائج منشور كنسب من دون درجات أساسية.

تعامل مع الجدول باعتباره فرضية Anthropic حول نموذجها، لا باعتباره قرار ترحيل جاهزاً. القرار الصحيح يأتي من قياس:

  • معدل النجاح على مهامك
  • تكلفة كل مهمة تم حلها
  • سلوك الأدوات والحلقات الوكيلية
  • زمن التنفيذ
  • الرفضات ومسارات الرجوع
  • أداء كل مستوى effort

راجع دليل أساسيات Opus 5 لبقية تغييرات النموذج.

الأسئلة الشائعة

هل تم التحقق من معايير Claude Opus 5 بشكل مستقل؟

لا. اعتباراً من 25 يوليو 2026، تأتي كل نتائج معايير Opus 5 المنشورة من Anthropic. لم ينشر مختبر طرف ثالث أو مقيم مستقل إعادة إنتاج للنتائج، لذا تعامل معها كبيانات أبلغ عنها البائع.

ما أكبر ادعاء لمعايير Opus 5؟

Frontier-Bench v0.1، حيث تقول Anthropic إن Opus 5 حقق أكثر من ضعف نتيجة Opus 4.8 بتكلفة أقل لكل مهمة. لم تنشر الشركة الدرجات الأساسية، بل النسبة فقط، والمعيار جديد ولا يملك سجل تتبع ثابتاً.

هل Claude Opus 5 هو نموذج Claude الأكثر قدرة؟

لا. يحتفظ Fable 5 بلقب «النموذج الأكثر قدرة الذي تم إصداره على نطاق واسع»، كما تذكر Anthropic أن Opus 5 يتخلف عن Mythos 5 في استغلال الأمن السيبراني والبحث البيولوجي المستقل.

ما مدى تحسن Opus 5 في المهام العلمية؟

تذكر Anthropic تحسناً قدره +10.2 نقطة في الكيمياء العضوية و+7.7 نقطة في تحليل البروتين مقارنةً بـ Opus 4.8. هذه فروق مطلقة، لذا فهي أوضح من الادعاءات النسبية، رغم عدم نشر الدرجات الأساسية.

هل يتفوق Opus 5 على Fable 5؟

وفقاً لأرقام Anthropic، يتفوق Opus 5 على Fable 5 في OSWorld 2.0 بثلث التكلفة، ويصل إلى 0.5% من ذروة Fable 5 في CursorBench 3.2 بنصف السعر. لكن Fable 5 يحتفظ بتصنيف القدرة الكلية. راجع المقارنة الكاملة.

ما الذي يجب أن أختبره بنفسي؟

اختبر بين 20 و50 مهمة حقيقية من قائمة مهامك، على مستويات جهد متعددة، مع أدواتك الفعلية وحلقات وكيلية متعددة الأدوار. قارن التكلفة لكل مهمة تم حلها ومعدل النجاح وسلوك الأدوات بالحل الذي تستخدمه اليوم.

Top comments (0)