DEV Community

Cover image for جمناي 4 أرجون مقابل جي بي تي 6 أسترا مقابل كلود أوبوس 5.5
Yusuf Khalidd
Yusuf Khalidd

Posted on Originally published at apidog.com

جمناي 4 أرجون مقابل جي بي تي 6 أسترا مقابل كلود أوبوس 5.5

يتصدر Gemini 4 Argon جدول مقاييس جوجل في 13 من أصل 19 صفًا مقارنةً بـ GPT-6 Astra وClaude Opus 5.5 وClaude Fable 5.1. لكن توجد حقيقة عملية أهم من نتائج المقاييس: يمكنك شراء Astra وOpus 5.5 اليوم، بينما لا يمكنك شراء Argon بعد. يتوفر نموذج جوجل الجديد حاليًا فقط لمدافعي برنامج Fairwind، بسعر تمهيدي قدره 2 دولار للإدخال و10 دولارات للإخراج لكل مليون رمز، ثم 4 دولارات و20 دولارًا لاحقًا؛ وهي الأسعار نفسها التي يفرضها Opus 5.5 بعد انتهاء الفترة التمهيدية.

جرّب Apidog اليوم

تقارن هذه المقالة النماذج الأربعة من حيث السعر والقيود، وتجمع نتائج المقاييس حسب النموذج الفائز، وتوضح سبب عدم قابلية الأرقام للمقارنة المباشرة دائمًا. وفي النهاية، ستنشئ اختبارًا عمليًا لتشغيل النماذج المتاحة على طلباتك الفعلية باستخدام Apidog. إذا كنت جديدًا على Argon، ابدأ بـما هو Gemini 4 Argon، وللتوقيت راجع دليل تاريخ إصدار Argon.

السعر والحدود جنبًا إلى جنب

يتضمن جدول جوجل Claude Fable 5.1، لذلك يظهر هنا أيضًا. الأسعار التالية لكل مليون رمز، وفق منشور إطلاق جوجل، وصفحة نموذج GPT-6 Astra من OpenAI، وصفحة أسعار Anthropic.

Gemini 4 Argon GPT-6 Astra Claude Opus 5.5 Claude Fable 5.1
هل يمكنك الاتصال به اليوم؟ لا، Fairwind فقط نعم نعم نعم
معرف نموذج API غير منشور gpt-6-astra claude-opus-5-5 claude-fable-5-1
الإدخال 2 دولارًا للتقديم، ثم 4 دولارات 10 دولارات 4 دولارات 10 دولارات
الإدخال المخزن مؤقتًا 0.10 دولارًا للتقديم، ثم 0.20 دولارًا 1 دولار 0.20 دولارًا 0.25 دولارًا
الإخراج 10 دولارات للتقديم، ثم 20 دولارًا 50 دولارًا 20 دولارًا 50 دولارًا
الحد الأقصى للإخراج 1 مليون، وفق حد جوجل المعلن 128 ألفًا 128 ألفًا، أو 300 ألف في Batch التجريبي 128 ألفًا
نافذة السياق غير منشورة 1,050,000، منها 922 ألفًا كحد أقصى للإدخال 1 مليون 1 مليون
رسوم إضافية للمطالبات الطويلة غير مذكورة فوق 272 ألف رمز إدخال: 2× للإدخال والتخزين المؤقت، و1.5× للإخراج على الطلب الكامل لا يوجد لا يوجد

هناك ثلاث نقاط يجب أخذها في الحسبان:

  1. سعر Argon القياسي يطابق Opus 5.5 في الإدخال، والإدخال المخزن مؤقتًا، والإخراج. لذا تظل أفضلية Argon السعرية موجودة فقط أثناء الفترة التمهيدية، ولم تحدد جوجل موعد انتهائها.
  2. Astra وFable 5.1 أغلى: تبلغ أسعار الإدخال والإخراج القياسية لهما 2.5× من أسعار Argon القياسية، و5× من أسعاره التمهيدية.
  3. حد الإخراج البالغ مليون رمز مصدره جوجل. بينما تسجل Vals AI حدًا يبلغ 262 ألف رمز لتكوين Argon الذي اختبرته.

لحساب تكلفة كل طلب وفق حجم الإدخال والإخراج، راجع تسعير Gemini 4 Argon.

أين يتصدر كل نموذج في جدول جوجل

قبل قراءة الأرقام، تذكر أن هذا جدول جوجل. نتائج Argon هي ما أبلغت عنه جوجل، وبعضها محسوب ذاتيًا وبعضها مأخوذ من لوحات صدارة. معظم نتائج المنافسين هي أرقام منشورة من البائعين أو من لوحات صدارة عامة، وغالبًا عند أعلى إعدادات الاستدلال المتاحة. بما أن الأدوات والإعدادات تختلف، تعامل مع الفجوات الصغيرة باعتبارها ضوضاء محتملة.

الرائد المعيار Argon Astra Fable 5.1 Opus 5.5
Argon: العمل المعرفي مؤشر Vals 68.9% 63.1% 65.8% 67.0%
Argon: العمل المعرفي AutomationBench 51.3% 41.4% 31.4% 42.5%
Argon: العمل المعرفي معيار وكيل هارفي القانوني 19.6% 5.4% 6.7% 3.8%
Argon: الترميز DeepSWE v1.1 77.9% 74.1% 67.4% 74.2%
Argon: سياق طويل GraphWalks 256 ألف إلى 1 مليون، F1 84.2% 71.8% 65.0% 66.8%
Argon: متعدد الوسائط LVBench 91.7% 87.5% 79.7% 83.7%
Argon: متعدد الوسائط Chartography 71.6% 71.0% 46.2% 66.3%
Astra FrontierSWE v2 55.0% 65.5% 56.3% 62.3%
Astra Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3%
Astra OSWorld-2.0، غير متصل جزئيًا 69.2% 72.6% لم يبلغ عنها لم يبلغ عنها
Opus 5.5 Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4%
Opus 5.5 PostTrainBench 45.3% 44.3% 40.2% 49.3%
تعادل CWE-bench v1 68.0% 68.0% 58.0% 67.0%

تشمل انتصارات Argon الصريحة الأخرى: Vals Finance Agent v2، وVibe Code Bench، وLABBench 2، وRiemannBench، وGraphWalks حتى 128 ألفًا، وAgent’s Last Exam. لا يتصدر Fable 5.1 أي صف في هذا الجدول.

في CWE-bench v1، تعرض لوحة صدارة DeepMind للأمن السيبراني تعادلًا ثلاثيًا عند 68% بين Argon وAstra وGrok 4.7، بينما يسجل Opus 5.5 نسبة 67%.

بالنسبة إلى Gemini 4 Argon مقابل Fable 5.1، يسجل Argon نتيجة أعلى في 15 من 17 صفًا يبلغان فيهما عن رقم. يتفوق Fable فقط في:

  • FrontierSWE v2: ‏56.3% مقابل 55.0%.
  • Terminal-bench 4.0: ‏57.9% مقابل 57.4%.

للتفاصيل، راجع مقاييس Claude Fable 5.1 ومقاييس Gemini 4 Argon.

ثلاثة محاذير قبل أن تثق بالفجوات

1. أرقام المنافسين ليست من تشغيل جوجل

توضح منهجية جوجل أن نتائج النماذج غير Gemini «مأخوذة من الأرقام المبلغ عنها ذاتيًا من قبل الموردين ما لم يُذكر خلاف ذلك». كما تأتي عدة صفوف من لوحات صدارة عامة تديرها Vals AI وProximal وSurge.

2. الأدوات وإعدادات التشغيل مختلفة

في DeepSWE v1.1، حسبت جوجل نتيجة Argon البالغة 77.9% ذاتيًا باستخدام mini-swe-agent. أما Astra فتأتي نتيجته من لوحة صدارة عامة، بينما تأتي نتائج Anthropic من بطاقات النظام.

وفي LVBench، أخذ Gemini عينات فيديو بمعدل إطار واحد في الثانية، بينما استخدم Astra 800 إطار، وOpus 5.5 عدد 600 إطار، وFable 5.1 عدد 300 إطار، وفقًا لما نُسب إلى «قيود API».

3. النموذج نفسه قد يسجل درجات مختلفة بين المخططات

تختلف نتيجة Terminal-bench 4.0 الخاصة بـOpus 5.5 حسب الأداة وإعداد الجهد. على سبيل المثال، تبلغ Anthropic عن 66.4% عند جهد xhigh.

قاعدة عملية: لا تجمع أرقامًا من مصادر مختلفة في جدول داخلي واحد لاتخاذ قرار إنتاجي. شغّل نفس المهمة، بنفس المدخلات، وبإعدادات متقاربة قدر الإمكان.

ماذا يقول المقيمون من طرف ثالث

تقلص لوحات الصدارة المستقلة الفجوة بين النماذج:

  • تضع Artificial Analysis Argon في المرتبة الثامنة من أصل 223، لكن القائمة تعد كل إعداد استدلال بشكل مستقل.
  • عند تجميع النتائج حسب النموذج المميز، يتعادل Argon بنتيجة 53 مع GPT-6 Astra وClaude Fable 5.1.
  • يتقدم Claude Opus 5.5 بنتيجة قصوى 58، ثم Claude Sonnet 5.5 بنتيجة 56.
  • تسجل Artificial Analysis معدل هلوسة Argon في AA-Omniscience عند 15%، مقابل 51% لـAstra عند أعلى إعداد له.

في Arena، يحتل Argon المرتبة الأولى ضمن فئة النصوص بنتيجة 1525، بتصنيف مبدئي يستند إلى 4,942 صوتًا، بينما يأتي Opus 5.5 في المرتبة الرابعة. كما تصنفه Vals AI أولًا من بين 41 نموذجًا في مؤشر Vals، وهو أول نموذج Gemini يتصدره.

لكن ليست كل الملاحظات إيجابية. فقد ذكرت بلومبرج أن بعض موظفي جوجل الذين لديهم وصول للنموذج يرونه مخيبًا للآمال في بعض مهام الترميز وتصميم الواجهة الأمامية مقارنةً بمقاييسه، وهو وصف قالت جوجل إنه غير دقيق.

أي نموذج يجب توجيه العمل إليه

لا يوجد نموذج رائد واحد مناسب لكل حمل عمل. استخدم التوجيه حسب المهمة، ثم اختبره على بياناتك قبل تثبيت القرار.

المهمة التوجيه اليوم عند إطلاق Argon
وكلاء الشؤون القانونية والمالية وأتمتة المكاتب Opus 5.5، مؤشر Vals بنسبة 67.0% اختبر Argon، فهو يتصدر صفوف العمل المعرفي الأربعة
وكلاء الترميز المعتمدون على الطرفيات بكثافة Opus 5.5، Terminal-bench 4.0 بنسبة 66.4% لا يزال Opus 5.5 متصدرًا في هذا المعيار
هندسة البرمجيات القائمة على الوكلاء Astra، FrontierSWE v2 بنسبة 65.5%، أو Opus 5.5 يتصدر Argon في DeepSWE ويتأخر في FrontierSWE؛ اختبر الاثنين
وكلاء استخدام الكمبيوتر وواجهة المستخدم الرسومية Astra، OSWorld-2.0 بنسبة 72.6% يتصدر Astra في OSWorld، بينما يتصدر Argon في Agent’s Last Exam
الاستدلال على مطالبات تتجاوز 256 ألف رمز Opus 5.5 بلا رسوم إضافية، أو Astra مع رسوم إضافية فوق 272 ألفًا Argon، GraphWalks من 256 ألف إلى مليون بنسبة 84.2%
فهم الفيديو والرسوم البيانية Astra، LVBench بنسبة 87.5% Argon، 91.7%، مع مراعاة اختلاف عدد الإطارات
العلوم وهندسة تعلم الآلة Astra في Terminal-Bench Science، وOpus 5.5 في PostTrainBench يتصدر Argon في LABBench 2 وRiemannBench؛ اختبره
استجابات فردية تتجاوز 128 ألف رمز Opus 5.5 عبر Batch، حتى 300 ألف رمز تجريبيًا Argon، حتى مليون رمز وفق جوجل
العمل عالي الحجم والحساس للتكلفة Opus 5.5 بسعر 4 دولارات / 20 دولارًا Argon بسعر 2 دولار / 10 دولارات طالما استمرت الفترة التمهيدية

إذا كانت التكلفة أهم من أعلى نتائج المقاييس، فراجع مقارنة GPT-6 Sol مقابل Claude Opus 5.5 لتغطية خط Sol الأرخص من OpenAI مقابل Opus.

قارن النماذج الثلاثة باستخدام طلباتك الخاصة

لا تستطيع جداول البائعين إخبارك كيف سيتعامل كل نموذج مع مستودعك، أو مخططات API لديك، أو تعليمات النظام الخاصة بك. أنشئ تقييمًا صغيرًا وقابلًا لإعادة التشغيل في Apidog بدل الاعتماد على معيار واحد.

1. أنشئ ثلاثة طلبات في مشروع واحد

أنشئ طلبًا لكل نموذج:

  • GPT-6 Astra
  • Claude Opus 5.5
  • Gemini، مع حقل نموذج يعتمد على متغير

استخدم متغيرًا مثل:

GEMINI_MODEL=gemini-3.8-flash
Enter fullscreen mode Exit fullscreen mode

احتفظ باسم النموذج في المتغير بدل تثبيته داخل الطلب. عند إعلان معرف Argon، غيّر قيمة المتغير فقط:

GEMINI_MODEL=<معرف_Argon_المنشور>
Enter fullscreen mode Exit fullscreen mode

راجع دليل GPT-6 Astra API وما هو Claude Opus 5.5 لتنسيق طلب كل بائع.

2. استخدم متغيرات بيئة للمفاتيح والمدخلات

خزن مفتاح API لكل بائع في متغيرات بيئة منفصلة:

OPENAI_API_KEY=...
ANTHROPIC_API_KEY=...
GEMINI_API_KEY=...
Enter fullscreen mode Exit fullscreen mode

ثم ضع نص المهمة في متغير مشترك لكي تستقبل النماذج الثلاثة المدخل نفسه:

EVAL_PROMPT=حلل هذا الخطأ، اقترح إصلاحًا، وأعد اختبارًا مناسبًا.
Enter fullscreen mode Exit fullscreen mode

بهذه الطريقة، لا يتغير بين التشغيلات سوى النموذج أو إعداداته، وليس نص المهمة.

3. أضف تأكيدات قابلة للقياس

أضف تأكيدات لكل طلب للتحقق من:

  • رمز حالة HTTP يساوي 200.
  • وجود نص غير فارغ في الإجابة.
  • بقاء رموز الإخراج تحت سقف محدد.
  • بقاء التكلفة المقدرة تحت ميزانيتك.
  • احتواء الإجابة على حقول أو كلمات رئيسية مطلوبة لمهمتك.

مثال منطقي لتأكيدات التقييم:

status_code == 200
response_text is not empty
output_tokens <= MAX_OUTPUT_TOKENS
estimated_cost_usd <= MAX_COST_USD
Enter fullscreen mode Exit fullscreen mode

4. شغّلها كسيناريو اختبار واحد

شغّل الطلبات الثلاثة ضمن سيناريو واحد، ثم قارن في تقرير الاختبار:

  1. صحة النتيجة.
  2. زمن الاستجابة.
  3. عدد رموز الإدخال والإخراج.
  4. تكلفة الطلب.
  5. عدد مرات فشل النموذج أو خروجه عن صيغة الإجابة المطلوبة.

احسب تكلفة الطلب بدل مقارنة سعر الرمز فقط

لنفترض أن طلبك يحتوي على 20,000 رمز إدخال و4,000 رمز إخراج.

GPT-6 Astra

تكلفة الإدخال = 20,000 × 10 / 1,000,000 = 0.20 دولار
تكلفة الإخراج = 4,000 × 50 / 1,000,000 = 0.20 دولار
الإجمالي = 0.40 دولار
Enter fullscreen mode Exit fullscreen mode

Claude Opus 5.5

تكلفة الإدخال = 20,000 × 4 / 1,000,000 = 0.08 دولار
تكلفة الإخراج = 4,000 × 20 / 1,000,000 = 0.08 دولار
الإجمالي = 0.16 دولار
Enter fullscreen mode Exit fullscreen mode

Gemini 4 Argon

السعر التمهيدي: 0.08 دولار
السعر القياسي: 0.16 دولار
Enter fullscreen mode Exit fullscreen mode

لكن سعر الرمز ليس تكلفة المهمة الفعلية. قدرت Artificial Analysis أن Argon يستخدم نحو 62 ألف رمز إخراج لكل مهمة، مقابل نحو 27 ألفًا لـAstra عند أعلى جهد. لذلك، قس رموز الإخراج على طلباتك الفعلية، ولا تعتمد على سعر المليون رمز وحده.

عند إتاحة Argon، حدّث قيمة GEMINI_MODEL، ثم أعد تشغيل السيناريو نفسه. ستحصل بذلك على مقارنة مباشرة بين النموذج الجديد والنموذجين اللذين يمكنك شراؤهما اليوم.

الأسئلة الشائعة

هل Gemini 4 Argon أفضل من GPT-6 Astra؟

يتعادلان بنتيجة 53 في Artificial Analysis. في جدول جوجل، يسجل Argon أعلى في معظم الصفوف، لكن Astra يفوز في FrontierSWE v2 وTerminal-Bench Science 0.1 وOSWorld-2.0. والأهم عمليًا: Astra متاح للاتصال اليوم.

Gemini 4 Argon مقابل Claude Opus 5.5: أيهما أفضل؟

يفضل جدول جوجل Argon في معظم الصفوف، بينما يفوز Opus 5.5 في Terminal-bench 4.0 وPostTrainBench. ويتصدر Opus 5.5 Artificial Analysis بنتيجة 58 مقابل 53 لـArgon. وفق الأسعار القياسية المعلنة، يكلف النموذجان المقدار نفسه.

هل Gemini 4 Argon أرخص من Claude Opus 5.5؟

أثناء الفترة التمهيدية، تبلغ تكلفة Argon نصف تكلفة Opus 5.5: ‏2 دولار / 10 دولارات مقابل 4 دولارات / 20 دولارًا. بعد ذلك، تتطابق الأسعار المعلنة، ولم تحدد جوجل موعد نهاية الفترة التمهيدية.

أي نموذج لديه أكبر حد إخراج؟

Argon، بحد معلن يبلغ مليون رمز، رغم أن Vals AI تسجل 262 ألفًا للتكوين الذي اختبرته. بقية النماذج تحدد الإخراج المتزامن عند 128 ألف رمز. راجع دليل مليون رمز إخراج لمعرفة أثر ذلك على عميلك.

هل يمكنني استخدام Gemini 4 Argon اليوم؟

فقط من خلال برنامج Fairwind من جوجل، لمجموعة من شركاء الدفاع السيبراني الموثوقين. سيأتي عملاء API المدفوعون ومشتركو Google AI Ultra لاحقًا، من دون تاريخ معلن.

اختر حسب عبء العمل، ثم اختبر

يبدو Argon الأقوى في العمل المعرفي والسياق الطويل والمهام متعددة الوسائط. يتفوق Astra في FrontierSWE وTerminal-Bench Science وOSWorld. ويتفوق Opus 5.5 في العمل الطرفي وهندسة تعلم الآلة، كما يطابق السعر الذي ستفرضه Argon بعد انتهاء فترته التمهيدية.

ابدأ بالنموذجين المتاحين اليوم، واجعل نموذج Gemini متغيرًا في بيئة الاختبار، ثم أعد تشغيل السيناريو عندما يصبح Argon متاحًا. لإعداد مقارنة الطلبات الثلاثة في مشروع واحد، نزّل Apidog.

Top comments (0)