rbtfl

وكلاء البرمجة يصبحون الميدان الرئيسي لإثبات القدرات في الذكاء الاصطناعي

Codex مع GPT-5.5 وكلود كود مع أوبوس 4.8 يتصدران قوائم تقييم الوكلاء مع تراجع مصداقية المعايير الثابتة

الذكاء الاصطناعي·الذكاء الاصطناعي· active كيف تتغيّر الحياة·اللعبة الطويلة ·4 قراءات · ·تحديث rbtfl 25 يونيو 2026
انشر

انقسام التغطية

الخبر نفسه كما تناولته غرف أخبار من دول مختلفة. كلماتهم، منسوبة ومربوطة بمصادرها.

United States

MarkTechPost

“Codex مع GPT-5.5 يتصدر Terminal-Bench بنسبة 83.4%، وكلود كود مع Fable 5 في المرتبة التالية بنسبة 83.1%.”

ML researchاقرأ النص الأصلي ↗

Global

decodethefuture

“ستة اختبارات باتت مهمة للوكلاء: الأفق الزمني الطويل، واستخدام الأدوات، والتكلفة، لا دقة الإجابة الفردية.”

developerاقرأ النص الأصلي ↗

انشر

الملخص

بحلول منتصف 2026، أصبح وكلاء البرمجة الميدان الرئيسي لإثبات القدرات في الذكاء الاصطناعي. يتصدر Codex مع GPT-5.5 معيار Terminal-Bench بنسبة نحو 83.4%، ويقترب منه كلود كود من Anthropic مع أوبوس 4.8 بنسبة نحو 83.1%، فيما يدخل وكلاء Antigravity من Google الساحة. جاء هذا التحول عقب تدقيق SWE-bench من أوبن إيه آي: مع تشكيك بمصداقية المعايير الثابتة، انتقل التقييم إلى مقاييس الأفق الزمني الطويل واستخدام الأدوات والتكلفة لكل مهمة. ويخدم Codex وحده أكثر من مليوني مستخدم أسبوعياً.

الانقسام

يرى قطاع النماذج أن النموذج الأساسي لا يزال محورياً؛ ويرى قطاع المنتجات أن التميز يكمن في الغلاف والمعزل وعمق التكامل. يتساءل العملاء المؤسسيون عن حدود القياس الموثوق لمهام عالم حقيقي.

بالأرقام

  • نحو 83.4%: أداء Codex مع GPT-5.5 على Terminal-Bench
  • نحو 83.1%: أداء كلود كود مع أوبوس/Fable 5
  • 2 مليون+ مستخدم أسبوعي لـCodex

لماذا يهم

ينتقل المزايا التنافسية من أوزان النموذج إلى الغلاف والمعزل والتكامل المحيطين به. يُغيّر ذلك طريقة شراء المؤسسات: بناءً على إتمام المهام والتكلفة، لا على عنوان المعيار.

ما الذي يجب رصده

معايير الوكلاء المقاومة للتزوير؛ أنظمة السلامة والأخطاء للوكلاء على الأنظمة الحية؛ مدى قدرة وكلاء مفتوحة المصدر على سد الفجوة.

الموجز، عبر البريد