سجل Claude Haiku 5.5 نسبة 72.4% في OSWorld 2.1، و1620 في GDPval-AA v2.1، و46.4% في FrontierCode 1.1، و39.2% في Terminal-Bench 4.0. سجل Haiku 4.5 نسبة 15.7% و735 و0.0% في ثلاثة من هذه المقاييس. جميعها أرقام أقصى جهد؛ عند الجهد الافتراضي medium، ينخفض GDPval-AA إلى 1277. لم تنشر أي مختبرات مستقلة نتائج Haiku 5.5 بعد.
فيما يلي كل معيار لـ Claude Haiku 5.5، ومن نفّذه، وكيف يؤثر مستوى الجهد في الأداء والتكلفة، وكيف تختبر النموذج على حركة المرور الخاصة بك في Apidog. للاطلاع على المواصفات والتسعير، ابدأ بـ ما هو Claude Haiku 5.5.
جدول الإطلاق
تستخدم كل خلية لـ Haiku 5.5 التفكير التكيفي بأقصى جهد، وعادةً ما تمثل متوسط خمسة تشغيلات. استخدم Terminal-Bench عشر تشغيلات لكل مهمة. تعني n/r عدم نشر أي نتيجة.
| المعيار | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (إيلو) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (إيلو) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1، مجموعة فرعية غير متصلة | 72.4% | 15.7% | 48.9% | 83.9% |
| آخر اختبار للبشرية، بدون أدوات | 45.9% | 10.2% | n/r | 56.9% |
| آخر اختبار للبشرية، مع أدوات | 57.4% | 18.7% | n/r | 64.5% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 (الرئيسي) | 46.4% | n/r | 42.4% | 52.1% (xhigh) |
| رسم الخرائط، بدون أدوات | 46.4% | 6.4% | 29.1% | 61.6% |
من أجرى كل معيار
أجرت أنثروبيك معظم الاختبارات بنفسها. تشترك الصفوف عبر البائعين في اسم المعيار، وليس بالضرورة في الأداة أو إعداد الجهد.
| المعيار | من أجراه | الشروط |
|---|---|---|
| GDPval-AA v2.1، AA-Briefcase v1.1 | Artificial Analysis، بشكل مستقل | GDPval-AA: 220 مهمة، و44 مهنة، وإيلو مرساة لـ DeepSeek V4.1 Flash عند 1600؛ Briefcase: مشاريع متعددة الأسابيع |
| FrontierCode 1.1 | Cognition | Claude في Claude Code، وGPT في Codex؛ الرئيسي = أصعب 100 من أصل 150 مهمة |
| رسم الخرائط | أنثروبيك، على معيار Surge AI | مصنف Gemini 3.5 Flash؛ نتيجة Luna من Surge AI |
| Terminal-Bench 4.0 | أنثروبيك | Claude Code مع --bare، و66 مهمة، و10 تشغيلات لكل مهمة، وإجراءات الحماية مفعّلة |
| OSWorld 2.1 | أنثروبيك | 82 من 108 مهام، بدقة 1080p، وحتى 500 خطوة |
| آخر اختبار للبشرية | أنثروبيك | ميزانية مهمة قدرها 980 ألف توكن، ومصنف Opus 4.6 |
يحتاج رقما GPT-6 Luna إلى سياق. أجرت أنثروبيك اختبار OSWorld لـ Luna عبر واجهة برمجة تطبيقات OpenAI على المهام الـ82 نفسها. تأتي نسبة Luna البالغة 16.4% في Terminal-Bench من لوحة المتصدرين العامة باستخدام Codex CLI وأقصى جهد.
في Terminal-Bench، أوقفت إجراءات الحماية 1.8% من تجارب Haiku 5.5، أي 12 من 660، واحتُسبت جميعها كإخفاقات.
مصيدة FrontierCode
يضع جدول الإطلاق Haiku 5.5 عند أقصى جهد، بنسبة 46.4%، بجوار Sonnet 5.5 عند xhigh بنسبة 52.1%، وهي أفضل نتيجة لـ Sonnet. تعرض بطاقة النظام الأرقام التالية:
| FrontierCode 1.1 | الرئيسي | ممتد |
|---|---|---|
| Haiku 5.5، أقصى | 46.4% | 58.4% |
Haiku 5.5، xhigh
|
45.8% | n/r |
| Sonnet 5.5، أقصى | 46.2% | 59.1% |
Sonnet 5.5، xhigh
|
52.1% | 64.4% |
بأقصى جهد، يتفوق Haiku 5.5 على Sonnet 5.5 في المعيار الرئيسي: 46.4% مقابل 46.2%. لكن عند مقارنة أفضل إعداد لكل نموذج، يتقدم Sonnet بفارق 5.7 نقاط.
عند اقتباس نتائج FrontierCode، اذكر دائمًا مستوى الجهد المستخدم.
إضافات بطاقة النظام
تضيف بطاقة النظام صفوفًا لم تظهر في منشور الإطلاق. جميع النتائج التالية بأقصى جهد ما لم يُذكر خلاف ذلك.
| المعيار | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64.8 | n/r | 81.3 |
| SWE-bench متعدد اللغات | 83.7 | 67.4 | 90.3 |
| SWE-bench متعدد الأنماط | 30.7 | 19.8 | 54.3 |
| OSWorld 2.1، معدل نجاح صارم | 37.1% | n/r | 48.8% |
| رسم الخرائط، مع أدوات | 86.2% | 8.8% | 90.2% |
| OfficeQA / OfficeQA Pro | 73.5% / 60.3% | 63.0% / 47.1% | 76.9% / 65.6% |
| HealthBench Professional، معدل للطول | 64.8% | 32.2% | 69.2% |
نسبة 72.4% في OSWorld هي درجة جزئية؛ إذ لا تنجح سوى 37.1% من المهام بالكامل. ويتضاعف أداء رسم الخرائط تقريبًا عند استخدام الأدوات، من 46.4% إلى 86.2%، لذا وفّر الأدوات لـ Haiku 5.5 عند تنفيذ مهام الرسم البياني.
نتائج الجهد الافتراضي أقل
يُضبط Haiku 5.5 على medium افتراضيًا في Claude API وClaude Code. تعرض بطاقة النظام النتائج التالية للجهد الافتراضي:
| المعيار | متوسط، افتراضي | أقصى | ملاحظة |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | يستخدم المتوسط نحو عُشر توكنات الإخراج المستخدمة في أقصى جهد |
| AA-Briefcase v1.1 | 1372 | 1578 | يستخدم المتوسط أقل من ربع توكنات الإخراج المستخدمة في أقصى جهد |
| HealthBench Professional | 59.9% | 64.8% | منخفض: 57.9%، مرتفع: 61.3% |
استدعِ واجهة API بدون output_config.effort إذا أردت سلوك العمود الأيسر. تغطي وثائق الجهد المستويات الخمسة جميعها.
النتيجة والتكلفة حسب الجهد
في الجداول التالية، التنسيق هو: النتيجة (التكلفة). تكلفة OSWorld وTerminal-Bench لكل محاولة، بينما GDPval-AA لكل مهمة.
| OSWorld 2.1 | منخفض | متوسط | مرتفع | Xhigh | أقصى |
|---|---|---|---|---|---|
| Haiku 5.5 | 42.0% ($0.07) | 53.3% ($0.13) | 61.3% ($0.18) | 67.6% ($0.28) | 72.4% ($0.61) |
| Sonnet 5.5 | 57.9% ($0.68) | 66.0% ($0.93) | 73.2% ($1.38) | 81.1% ($2.22) | 83.9% ($5.73) |
| GPT-6 Luna | 19.2% ($0.04) | 37.5% ($0.13) | 42.3% ($0.14) | 44.8% ($0.17) | 48.9% ($0.21) |
| GDPval-AA v2.1 | منخفض | متوسط | مرتفع | Xhigh | أقصى |
|---|---|---|---|---|---|
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Terminal-Bench 4.0 | منخفض | متوسط | مرتفع | Xhigh | أقصى |
|---|---|---|---|---|---|
| Haiku 5.5 | 12.7% ($0.42) | 20.3% ($0.68) | 24.8% ($1.04) | 31.5% ($1.75) | 39.2% ($2.64) |
| Sonnet 5.5 | 20.0% ($0.62) | 28.8% ($0.68) | 43.0% ($1.46) | 61.5% ($4.34) | 70.6% ($10.44) |
النقاط العملية:
-
الانتقال إلى أقصى جهد مكلف في خطوته الأخيرة. في GDPval-AA، يكلف أقصى جهد نحو 28 ضعف المتوسط مقابل 343 نقطة إيلو إضافية. وفي OSWorld، يكلف أقصى جهد أكثر من ضعف
xhighمقابل 4.8 نقطة فقط. - يتفوق Haiku 5.5 عند المتوسط على Luna عند أقصى جهد في OSWorld: 53.3% مقابل $0.13، مقارنة بـ48.9% مقابل $0.21. لكن Luna أرخص في كل مستوى مماثل آخر تقريبًا. راجع Haiku 5.5 مقابل GPT-6 Luna.
- يتفوق Haiku 5.5 عند أقصى جهد على Sonnet 5.5 عند المتوسط في OSWorld: 72.4% مقابل $0.61، مقارنة بـ66.0% مقابل $0.93.
- Terminal-Bench هو الاستثناء. يتفوق Sonnet 5.5 عند المستوى المرتفع، 43.0% و$1.46، على Haiku 5.5 عند أقصى جهد، 39.2% و$2.64، مع تكلفة أقل. تستخدم تكاليف Sonnet سعر قراءة ذاكرة التخزين المؤقت الجديد البالغ $0.10.
تستخدم هذه التكاليف أسعار القائمة: $0.10 / $0.50 لكل مليون توكن للمطالبات التي تصل إلى 100 ألف توكن، وأسعارًا أعلى لما يزيد على ذلك. راجع تفاصيل التسعير.
المجالات التي لا يزال Haiku 5.5 يتخلف فيها
يتصدر Sonnet 5.5 كل صف في جدول الإطلاق. الفوز المباشر الوحيد لـ Haiku هو في FrontierCode عندما يعمل النموذجان بأقصى جهد متماثل.
أكبر فجوة تظهر في Terminal-Bench 4.0: 39.2% لـ Haiku مقابل 70.6% لـ Sonnet. ويظهر النمط نفسه في SWE-Bench Pro، بنتيجة 64.8 مقابل 81.3، وفي SWE-bench متعدد الأنماط، بنتيجة 30.7 مقابل 54.3.
توافق أنثروبيك على ذلك: ما زال Sonnet 5.5 وOpus 5.5 خيارين أفضل لمهام الترميز المعقدة القائمة على الوكلاء. يناسب Haiku 5.5 الأعمال ذات النطاق الضيق، مثل:
- الضغط والتلخيص
- التصنيف
- استخدام المتصفح
- الوكلاء الفرعيون ضمن نظام يقوده نموذج أكبر
للتطبيق العملي، راجع Haiku 5.5 في Claude Code لتشغيله كوكيل فرعي منخفض التكلفة.
النتائج المستقلة: لا توجد بعد
حتى 8 أكتوبر 2026، لم ينشر أي مختبر مستقل نتائج Haiku 5.5. تعرض صفحة Artificial Analysis الخاصة بـ Haiku 5.5 خطأ 404، بينما تسرد لوحة المتصدرين Claude 4.5 Haiku فقط.
لم تعرض Vals أو LMArena أو SWE-bench أو Aider أي نتائج أيضًا. كما لا توجد أرقام سرعة من طرف ثالث. تصف أنثروبيك Haiku 5.5 بأنه "أسرع نموذج حتى الآن" بالسرعة القياسية، لكنه أبطأ من Opus في الوضع السريع.
أقرب رقم خارجي يأتي من Cursor. تذكر وثائق النموذج أن Haiku 5.5 يحقق 48.4% في CursorBench بأقصى جهد، ارتفاعًا من 30.9% عند المستوى المنخفض. ومع إيقاف التفكير، تسجل Cursor ما بين 22.1% و26.2% عند مستويات الجهد نفسها التي سجل فيها التفكير من 30.9% إلى 42.3%.
ماذا يبلغ العملاء
المعلومات التالية مأخوذة من منشور إطلاق أنثروبيك ولم يتم التحقق منها بشكل مستقل:
- HubSpot: حقق 92.8% في المتوسط عبر ثلاث جولات على مجموعة بوابات CRM المحاكاة الخاصة بها، وهي أفضل نتيجة رأتها في تلك المجموعة.
- AlphaSense: حقق 0.84 مقابل 0.76 لـ Haiku 4.5 على 400 استعلام من نوع "اسأل في المستند"، وهو ما تعتبره الشركة ذا دلالة إحصائية.
- Box: حقق زيادة قدرها 11 نقطة مقارنة بـ Haiku 4.5، وبنحو نصف زمن الوصول، في الاختبارات المبكرة.
- Asana: خفض زمن الوصول لإكمال المهام بأكثر من 30% مقارنة بالنموذج الحالي.
- Cognition: يحقق Devin Fusion درجة FrontierCode تبلغ 66.2 باستخدام Haiku 5.5 كرفيق وOpus 5.5 كقائد. هذا نظام ثنائي النماذج، وليس Haiku وحده.
قم بتشغيل تقييمك الخاص
لا تشبه المعايير بالضرورة حركة مرور تطبيقك. يقترح دليل المطالبات من أنثروبيك استخدام xhigh أو أقصى جهد فقط عندما تُظهر تقييماتك مكسبًا واضحًا، وتشغيل التقييمات نفسها على Sonnet 5.5 للمقارنة.
نفّذ ذلك في Apidog كالتالي:
- خزّن
ANTHROPIC_API_KEYكمتغير بيئة، واحفظ من 20 إلى 50 مطالبة حقيقية كطلبات Messages. - أضف تأكيدات تشمل حالة
200، وقيمةstop_reasonلا تساوي"max_tokens"أو"refusal"، والمحتوى المطلوب في الإجابة الصحيحة. - شغّل المجموعة عند
lowوmediumوhigh. لاحظ أن تغيير الجهد يُبطل ذاكرة التخزين المؤقت للمطالبات. - سجّل معدل النجاح وعدد التوكنات من كائن
usage. ينتج المحلل اللغوي الجديد نحو 30% توكنات أكثر من Haiku 4.5 للنص نفسه. - انسخ المجموعة، واستبدل النموذج بـ
claude-sonnet-5-5، ثم قارن النموذجين في المشروع نفسه.
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [{
"role": "user",
"content": "Classify this support ticket as billing, bug or feature request: ..."
}]
}'
لا ترسل temperature أو top_p أو top_k أو تعبئة مسبقة للمساعد؛ إذ يعيد كل منها خطأ 400 مع Haiku 5.5.
حدّد كتل الاستجابة عبر الحقل type، لأن كتلة thinking قد تأتي أولًا. لمزيد من التنفيذ، راجع دليل API واختبار تطبيقات LLM.
الأسئلة الشائعة
هل Claude Haiku 5.5 أفضل من Sonnet 5.5؟
ليس وفقًا لأرقام أنثروبيك. يتصدر Sonnet 5.5 كل صف في جدول الإطلاق. يتفوق Haiku عليه فقط في FrontierCode عندما يعمل كلاهما بأقصى جهد، بنتيجة 46.4% مقابل 46.2%. راجع Haiku 5.5 مقابل Haiku 4.5 للحصول على نظرة عامة حول الترقية.
ما نتيجة Haiku 5.5 في SWE-bench؟
حقق 64.8 في SWE-Bench Pro، و83.7 في SWE-bench متعدد اللغات، و30.7 في SWE-bench متعدد الأنماط. جميعها عند أقصى جهد.
ما مستوى الجهد المستخدم في المعايير؟
أقصى جهد، مع متوسط خمسة تشغيلات غالبًا. المستوى الافتراضي في API هو medium، حيث يسجل GDPval-AA نتيجة 1277 بدلًا من 1620.
هل توجد معايير مستقلة لـ Haiku 5.5؟
لا توجد بعد. شغّلت Artificial Analysis معياري GDPval-AA وAA-Briefcase بشكل مستقل، لكن أنثروبيك هي التي نشرت النتائج، ولا توجد صفحة لـ Haiku 5.5 لدى AA.
هل GPT-6 Luna أرخص؟
عادةً، نعم. تكلف Luna أقل عند كل مستوى جهد لـ GDPval-AA، وعند كل مستوى لـ OSWorld باستثناء medium، حيث تتساوى التكلفة تقريبًا. مع ذلك، يسجل Haiku 5.5 درجات أعلى في المعيارين.
الخطوة التالية
ابدأ بـ medium، ثم ارفع مستوى الجهد فقط عندما يبرر تحسن معدل النجاح التكلفة الإضافية.
نزّل Apidog، وأنشئ مجموعة التقييم السابقة، واحتفظ بالنتائج في Apidog بجوار خط أساس Sonnet 5.5 قبل تحويل حركة المرور الإنتاجية.
Top comments (0)