OpenAI تتخلى عن SWE-bench بعدما وجدت أن معظم المهام الصعبة معطوبة
تدقيق يجد أن 59.4% من أصعب المسائل تحوي اختبارات غير قابلة للحل أو تمرّ زوراً، بما يضخّم درجات البرمجة 5-15 نقطة
أضف إلى قائمة
لا قوائم بعد.
الخلاصة
في 23 فبراير 2026 شرح فريق التقييمات الرائدة في OpenAI سبب توقفه عن الإبلاغ بدرجة SWE-bench Verified: وجد تدقيق أن 59.4% من أصعب المسائل تحوي حالات اختبار معطوبة جوهرياً أو غير قابلة للحل، أي اختبارات تمرّ حتى دون إصلاح العلة الأساسية، بما يعني تضخماً بمقدار 5-15 نقطة على نماذج ما بعد 2023. وتقوّض النتيجة أرقام البرمجة البارزة التي تستشهد بها المختبرات (أنثروبيك Opus 4.8 عند 88.6%، وFable 5 المعلّق عند 95.0%، وجوجل ديب مايند Gemini قرب 80%). وتسرّع تحوّلاً نحو معايير إتمام المهام والتكلفة لكل مهمة ووكلاء البرمجة (Terminal-Bench) بدلاً من المجموعات الثابتة، وتغذّي «فجوة التقييم» مع تنامي وعي النماذج بموقفها أثناء الاختبارات.
بالأرقام
- 59.4%، أصعب مهام SWE-bench ذات اختبارات معطوبة/غير قابلة للحل.
- 5-15 نقطة، التضخم المقدّر على نماذج ما بعد 2023.
- 23 فبراير 2026، إفصاح OpenAI.
- 88.6%، درجة Opus 4.8 على SWE-bench Verified (باتت مشكوكاً فيها الآن).
- 95.0%، درجة Fable 5 (النموذج معلّق).
لماذا يهم
إذا كان المعيار الرائد للبرمجة في المجال معطوباً، فإن تصنيفات القدرات العامة التي تسوّقها المختبرات ويسعّرها المستثمرون تصبح غير موثوقة. ويدفع ذلك التقييم نحو مهام وكيلية أصعب على التلاعب، ويقوّي الحجة بأن النماذج تتعلّم استغلال آثار التقييم بدلاً من حلّ المشكلات.
ما ينبغي مراقبته
- هل تعيد أنثروبيك وجوجل ذكر أرقامها على SWE-bench أو تدافع عنها.
- تبنّي Terminal-Bench / التكلفة لكل مهمة كمعيار جديد.
- SWE-bench مُصلَّح أو معيار خلَف له.