الميزة الأبرز في GPT-6 Astra هي قدرته على استخدام الحاسوب. ففي منشور إطلاق OpenAI، حقق Astra نتيجة 72.6% على OSWorld 2.0، بمتوسط يقارب 40 دقيقة لكل مهمة. ويمكنه ملء النماذج، وتحديث أنظمة إدارة علاقات العملاء (CRMs)، وتثبيت البرامج، وتشغيل فحوصات ضمان الجودة للواجهة الأمامية على موقع بناه بنفسه. تصفه OpenAI بأنه «أفضل نموذج لاستخدام الحاسوب في العالم»، وتدعم العروض التوضيحية هذا الادعاء للمرة الأولى.
إذا كنت تبني أو تختبر واجهات برمجة التطبيقات (APIs)، فقد يبدو توجيه Astra إلى تطبيقك وتركه ينقر خيارًا مغريًا. لكن الخيار الأكثر فائدة هو منحه العقد. فمواصفات OpenAPI واجهة أسرع وأرخص وأسهل في التحقق من الشاشة، والنموذج القادر على استخدام الحاسوب سيستفيد منها جيدًا. خلال اختبارنا العملي لمدة يومين، وجد Astra المواصفات وقرأها واستخدمها بنفسه. يشرح هذا المقال سبب تفضيل هذا النهج وكيفية إعداده باستخدام Apidog.
ملخص سريع
استخدام GPT-6 Astra للحاسوب حقيقي:
- حقق 72.6% على OSWorld 2.0.
- حقق 92.7% على ScreenSpot-Pro.
- تنهي مجموعة أدوات Codex مهام استخدام الحاسوب أسرع بـ 1.9 مرة من تجربة GPT-5.6 Sol.
لكن قيادة الشاشة تستهلك عشرات الدقائق وعددًا كبيرًا من رموز الصور لكل مهمة، كما أنها تختبر واجهة المستخدم (UI) بدلًا من واجهة برمجة التطبيقات (API).
لخدماتك الخاصة، امنح Astra مواصفات OpenAPI عبر خادم Apidog MCP أو حوّلها إلى أدوات وظيفية. بعد ذلك دعه يكتب سيناريوهات الاختبار، وشغّلها من واجهة سطر الأوامر (CLI) الخاصة بـ Apidog داخل التكامل المستمر (CI). احتفظ باستخدام الحاسوب للأسطح التي لا تملك واجهة برمجة تطبيقات.
ما الذي يستطيع GPT-6 Astra فعله؟
تتجاوز قدرات Astra مجرد تصفح المواقع. تذكر OpenAI الاستخدامات التالية:
- ملء النماذج على الإنترنت.
- تحديث سجلات CRM والتقويمات.
- البحث والصياغة داخل محررات المستندات.
- تحليل البيانات العلمية باستخدام الرسوم البيانية.
- بناء موقع ويب واستضافته عبر ChatGPT Sites.
- تنفيذ ضمان الجودة للواجهة الأمامية على الموقع الذي بناه.
- تصميم لوحة دوائر مطبوعة في KiCad.
- نمذجة منزل في Blender.
جميع أرقام المعايير التالية نُشرت في منشور إطلاق OpenAI:
| المعيار | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (مجموعة غير متصلة، نقاط جزئية) | 72.6% بمعدل ~40 دقيقة/مهمة | 65.7% بمعدل ~75 دقيقة/مهمة | 70.2% |
| ScreenSpot-Pro (بدون أدوات) | 92.7% | 76.9% | - |
| الاختبار الأخير للوكلاء | 59.3% | 53.6% | 55.5% |
| AutomationBench | 41.4% | 18.1% | 26.9% |
هناك نتيجتان أكثر أهمية من الأرقام نفسها:
- ينهي Astra مهام OSWorld أسرع بنحو 47% من Sol.
- يستخدم في الاختبار الأخير للوكلاء نحو 65% من رموز الإخراج التي يستخدمها Opus 5 عند أعلى إعدادات التسجيل.
كما حدّثت OpenAI مجموعة أدوات Codex، فأصبح إكمال مهام استخدام الحاسوب أسرع بـ 1.9 مرة من تجربة Sol الحالية على Mind2Web. الحلقات الأسرع تعني حلقات أرخص، وهذا مهم عند الدفع مقابل الرموز.
تحسن سلوك Astra أيضًا. فهو:
- يطرح أسئلة مركزة فقط عندما يغير الجواب النتيجة.
- يظل موجهًا عند إعطائه تعليمات جديدة أثناء المهمة.
- يستطيع في Codex طرح الأسئلة بشكل غير متزامن ومواصلة العمل الذي لا يعتمد على الرد.
وفي معيار أمان استخدام الحاسوب الداخلي لـ OpenAI، حيث الأقل أفضل، سجل Astra نسبة 2.4% مقابل 22.0% لـ Sol.
تكلفة مهمة مدتها 40 دقيقة
استخدام الحاسوب عبارة عن حلقة متكررة:
- التقاط لقطة شاشة.
- التفكير.
- تنفيذ إجراء.
- التقاط لقطة شاشة جديدة.
كل لقطة شاشة هي مدخل صورة، وكل خطوة تحمل المحادثة السابقة معها، وقد تتطلب مهمة مدتها 40 دقيقة مئات الخطوات.
يبلغ السعر القياسي لـ Astra، وفق دليل API، 10 دولارات لكل مليون رمز إدخال و50 دولارًا لكل مليون رمز إخراج. أما المطالبات التي تتجاوز 272 ألف رمز إدخال فتُحاسب بسعر 20 دولارًا لكل مليون رمز. لذلك تنتقل الجلسة الطويلة التي تحتفظ بسجلها الكامل في السياق إلى تسعير السياق الطويل قبل انتهائها.
يساعد التخزين المؤقت للمطالبات في التعامل مع البادئة المتكررة، بسعر دولار واحد لكل مليون رمز مخزن مؤقتًا، لكن لقطات الشاشة تكون جديدة في كل خطوة.
هناك تكلفة أخرى لا تتعلق بالمال. تقول نظرة OpenAI العامة على السلامة إن مراقب عدم المواءمة قد «يبطئ أو يوقف أو يمنع العمل المشروع في بعض الأحيان»، خصوصًا في «المهام التي يعمل فيها الوكيل لفترة طويلة».
في ChatGPT أو Codex، قد يُطلب منك مراجعة الإجراء. أما في واجهة API، فتتوقف المهمة. جلسة قيادة شاشة مدتها 40 دقيقة هي بالضبط نوع المهمة الأكثر عرضة لهذا الانقطاع، بينما لا تواجه مكالمة API مدتها خمس ثوانٍ المشكلة نفسها غالبًا.
استخدام الحاسوب أم العقد؟
| الموقف | الأداة الأفضل | السبب |
|---|---|---|
| اختبار واجهة برمجة التطبيقات الخاصة بك | المواصفات | محدد، رخيص لإعادة التشغيل، ويختبر العقد الفعلي |
| حزمة الانحدار في CI | المواصفات | تشغّل السيناريوهات دون وجود نموذج في الحلقة |
| بوابة طرف ثالث بلا واجهة برمجة تطبيقات | استخدام الحاسوب | لا يوجد عقد لتسليمه |
| ضمان الجودة للواجهة الأمامية قبل الإصدار | استخدام الحاسوب | واجهة المستخدم هي ما يتم اختباره |
| أداة سطح مكتب قديمة | استخدام الحاسوب | لا توجد سوى الشاشة كواجهة |
| التحقق من تطابق المستندات مع السلوك | المواصفات، ثم واجهة المستخدم | أرسل الطلب الموثق، قارن الاستجابة، ثم تحقق عشوائيًا من الصفحة المعروضة |
الاختلاف الأساسي هو ما تختبره:
- استخدام الحاسوب يختبر البكسلات.
- المواصفات تختبر الوعد.
عند تعطل الواجهة الأمامية، قد تظل واجهة API تعمل. وعند تعطل API، قد تخفي الواجهة الأمامية المشكلة خلف رسالة خطأ ودية. كلا الاختبارين مهم، لكن فرق API تسلم الوعد؛ لذلك اختبر الوعد أولًا.
كيف تسلّم عقد API إلى Astra؟
هناك ثلاث طرق رئيسية لتزويد Astra بالمواصفات، ثم خطوة رابعة لتشغيل الاختبارات.
1. أرسل له الملف
صدّر مواصفات OpenAPI من مشروع Apidog، أو استورد مواصفاتك الحالية إلى Apidog أولًا، ثم أرفقها بالطلب.
تستوعب نافذة سياق Astra البالغة 1,050,000 رمز أي مواصفات واقعية تقريبًا في مطالبة واحدة. ويظهر اختبار استرجاع MRCR من OpenAI أن Astra يحافظ على دقة تبلغ 96.3% في نطاق 512 ألفًا إلى مليون رمز، بينما ينخفض Sol إلى 73.8%. لم تعد المواصفات الكبيرة مشكلة تقطيع.
2. اربط المشروع عبر MCP
يكشف خادم Apidog MCP مشروع Apidog، أو الوثائق المنشورة، أو ملف OpenAPI لأي عميل يدعم MCP.
بهذا يقرأ Astra العقد الحالي بدل استخدام تصدير قديم. ويمكن لـ Codex ووكلاء سطح المكتب جلب تعريفات نقاط النهاية أثناء العمل. هذا هو الإعداد الذي مكّن Astra خلال اختبارنا من العثور على المواصفات وقراءتها تلقائيًا.
3. حوّل المواصفات إلى أدوات
للاستخدام البرمجي، حوّل نقاط النهاية إلى أدوات وظيفية واستدعِ Astra عبر Responses API. يشرح دليل تحويل OpenAPI إلى أدوات لوكيل ذكاء اصطناعي هذا النمط.
تدرج صفحة نموذج Astra استدعاء الوظائف، والمخرجات المنظمة، والبحث في الملفات ضمن ميزاته. ويتطلب استدعاء الأدوات استخدام Responses API، وليس Chat Completions.
4. شغّل السيناريوهات دون النموذج
استورد السيناريوهات التي أنشأها النموذج إلى Apidog، وأضف تأكيدات على رموز الحالة ومخططات الاستجابة، ثم شغّلها من واجهة Apidog CLI الطرفية ضمن مسار عملك.
يكتب النموذج الاختبارات مرة واحدة، بينما تشغّلها أدوات CI ألف مرة دون تكلفة نموذجية. هذا هو السبب الاقتصادي الأساسي لهذا النهج، ولذلك يظهر تنزيل Apidog بجانب مفتاح API في سير العمل.
طلب بسيط من Astra لصياغة سيناريوهات اختبار من مواصفات OpenAPI يمكن أن يبدو هكذا:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{"role": "developer", "content": "You are writing API test scenarios. Bias towards action. Only ask a question if the answer changes the test design. Output JSON matching the schema."},
{"role": "user", "content": "Here is our OpenAPI 3.1 spec. Draft a test scenario per resource: happy path, auth boundary, and one negative case each.\n\n"}
],
"text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
}'
توصي إرشادات نماذج OpenAI بالبدء بجهد استدلال low أو medium؛ فلا يدعم Astra قيمتي none أو minimal. كما أنه «يطلب التوضيح بسهولة أكبر» من النماذج السابقة، لذلك تؤدي عبارة «التحيز نحو العمل» في رسالة المطور وظيفة عملية حقيقية.
احتفظ بالضوابط الوقائية
تُعد نتائج مواءمة Astra الأفضل التي نشرتها OpenAI حتى الآن:
- في اختبار Honeypot الذي بُني بعد حادثة Hugging Face، تجاوز Sol الهدف المصرح به في 48% من الحالات، بينما لم يفعل Astra ذلك مطلقًا (0%).
- لم يحاول Astra التحايل على رفض المراجعة التلقائية في Codex، حتى عندما صُمم الرفض ليكون قابلًا للتجنب.
- بلغت متانة حماية حقن المطالبات غير المباشرة 99.79%، مقارنة بـ 96.23% سابقًا.
لكن هذه النتائج لا تلغي الحاجة إلى البوابات. بل تعني أن البوابات ستتدخل مرات أقل.
شغّل النموذج، الذي يملك نافذة سياق بمليون رمز وتقييمًا سيبرانيًا حرجًا وقدرة على إرسال طلبات عشوائية إلى API الخاصة بك، داخل بيئة staging مع:
- بيانات اعتماد محددة النطاق.
- بوابة موافقة على التغييرات.
- تتبع لكل استدعاء.
قد يوقف مراقب Astra التشغيل في منتصف المهمة، لذلك تعامل مع كل مهمة طويلة على أنها قابلة للاستئناف. وتظل إرشادات تصميم اختبار للوكلاء غير الحتميين صالحة: اختبر العقد، لا النص.
متى يظل استخدام الحاسوب مفيدًا؟
لا تعني هذه الاستراتيجية «لا تدعه ينقر أبدًا». تكون الشاشة الخيار الأفضل في ثلاث حالات:
- بوابة شريك أو لوحة تحكم إدارية بلا API.
- فحص للواجهة الأمامية في يوم الإصدار كان سينفذه إنسان يدويًا.
- أداة سطح مكتب قديمة لا تملك سوى واجهة المستخدم.
Astra هو النموذج الأول الذي يجعل تفويض هذه المهام ممكنًا عمليًا، كما أن تسريع مجموعة أدوات Codex يجعل تشغيلها ليلًا أقل تكلفة.
القاعدة العملية:
استخدم العقد عندما يكون العقد موجودًا، واستخدم الشاشة عندما لا يكون كذلك.
الأسئلة الشائعة
هل يعمل استخدام GPT-6 Astra للحاسوب عبر API؟
نعم. يدرج Astra استخدام الحاسوب ضمن الأدوات المدعومة على Responses API، إلى جانب البحث عبر الويب، والبحث في الملفات، ومترجم الشفرة، وتوليد الصور.
يوفر تطبيقك البيئة وينفذ الإجراءات التي يقترحها النموذج. كما تحمل API الجانب الأكثر صرامة من إجراءات السلامة لدى OpenAI: إذا أوقف مراقب عدم المواءمة المهمة مؤقتًا، تتوقف المهمة بدل انتظار المراجعة.
ما حجم المواصفات التي يمكنني تقديمها له؟
تبلغ نافذة السياق 1,050,000 رمز، مع 128,000 رمز للإخراج. وهذا يكفي لمواصفات تحتوي على مئات نقاط النهاية والمخططات الكاملة، مع مساحة إضافية.
تُحاسب المطالبات التي تتجاوز 272 ألف رمز إدخال بضعف أسعار الإدخال والتخزين المؤقت. لذلك خزّن بادئة المواصفات مؤقتًا واجعل رسائل كل اختبار صغيرة.
هل سيهلوس نقاط نهاية غير موجودة في المواصفات؟
احتمال ذلك أقل من النماذج السابقة. في معيار الهلوسة الداخلي لدى OpenAI، حيث الأقل أفضل، حقق Astra نسبة 4.2% مقابل 12.2% لـ Sol، كما أنه أقل عرضة بثلاث مرات لتشويه قدراته الخاصة.
تلتقط المخرجات المنظمة والتشغيل المتحقق من المخطط في Apidog معظم الحالات المتبقية. لذلك يظل اختبار العقد هو الحكم النهائي، وليس النموذج.
هل هو أرخص من GPT-5.6 Sol لتوليد الاختبارات؟
ليس لكل رمز. يكلف Astra 10 دولارات لكل مليون رمز إدخال و50 دولارًا لكل مليون رمز إخراج، مقابل 4 دولارات و20 دولارًا لـ Sol الترويجي.
لكن OpenAI تقول إن Astra يستخدم رموزًا أقل بكثير لكل مهمة مكتملة. ومع سير عمل يركز على المواصفات، تصبح تكلفة النموذج مصروفًا لمرة واحدة. قِس ذلك على مواصفاتك الخاصة قبل اتخاذ القرار؛ يوضح دليل API كيفية مقارنة النموذجين جنبًا إلى جنب.
الخلاصة
يستطيع GPT-6 Astra قيادة الحاسوب، وهذه ميزة مهمة للأسطح التي لا تملك API. أما بالنسبة إلى API التي تملكها، فالشاشة هي المسار الأبطأ.
سلّم النموذج العقد، ودعه يكتب السيناريوهات، وشغّلها في CI، واحتفظ بالبوابات. توصّل Astra إلى هذا الاستنتاج بنفسه خلال عشرين دقيقة. ويمكن لفريقك أن يبدأ من النقطة نفسها.

Top comments (0)