وكلاء البرمجة يصبحون الميدان الرئيسي لإثبات القدرات في الذكاء الاصطناعي
Codex مع GPT-5.5 وكلود كود مع أوبوس 4.8 يتصدران قوائم تقييم الوكلاء مع تراجع مصداقية المعايير الثابتة
أضف إلى قائمة
لا قوائم بعد.
الملخص
بحلول منتصف 2026، أصبح وكلاء البرمجة الميدان الرئيسي لإثبات القدرات في الذكاء الاصطناعي. يتصدر Codex مع GPT-5.5 معيار Terminal-Bench بنسبة نحو 83.4%، ويقترب منه كلود كود من Anthropic مع أوبوس 4.8 بنسبة نحو 83.1%، فيما يدخل وكلاء Antigravity من Google الساحة. جاء هذا التحول عقب تدقيق SWE-bench من أوبن إيه آي: مع تشكيك بمصداقية المعايير الثابتة، انتقل التقييم إلى مقاييس الأفق الزمني الطويل واستخدام الأدوات والتكلفة لكل مهمة. ويخدم Codex وحده أكثر من مليوني مستخدم أسبوعياً.
الانقسام
يرى قطاع النماذج أن النموذج الأساسي لا يزال محورياً؛ ويرى قطاع المنتجات أن التميز يكمن في الغلاف والمعزل وعمق التكامل. يتساءل العملاء المؤسسيون عن حدود القياس الموثوق لمهام عالم حقيقي.
بالأرقام
- نحو 83.4%: أداء Codex مع GPT-5.5 على Terminal-Bench
- نحو 83.1%: أداء كلود كود مع أوبوس/Fable 5
- 2 مليون+ مستخدم أسبوعي لـCodex
لماذا يهم
ينتقل المزايا التنافسية من أوزان النموذج إلى الغلاف والمعزل والتكامل المحيطين به. يُغيّر ذلك طريقة شراء المؤسسات: بناءً على إتمام المهام والتكلفة، لا على عنوان المعيار.
ما الذي يجب رصده
معايير الوكلاء المقاومة للتزوير؛ أنظمة السلامة والأخطاء للوكلاء على الأنظمة الحية؛ مدى قدرة وكلاء مفتوحة المصدر على سد الفجوة.