rbtfl

OpenAI تتخلى عن SWE-bench بعدما وجدت أن معظم المهام الصعبة معطوبة

تدقيق يجد أن 59.4% من أصعب المسائل تحوي اختبارات غير قابلة للحل أو تمرّ زوراً، بما يضخّم درجات البرمجة 5-15 نقطة

الذكاء الاصطناعي·الذكاء الاصطناعي· contested-result ما لا يقولونه·التحوّل الصامت ·4 قراءات · ·تحديث rbtfl 25 يونيو 2026
انشر

انقسام التغطية

الخبر نفسه كما تناولته غرف أخبار من دول مختلفة. كلماتهم، منسوبة ومربوطة بمصادرها.

United States

MarkTechPost

“وجدت OpenAI أن 59.4% من أصعب مهام SWE-bench كانت اختباراتها تمرّ حتى حين تبقى العلة الأساسية دون إصلاح.”

ML researchاقرأ النص الأصلي ↗

United States

Morph LLM (coding leaderboard)

“كلود Opus 4.8 يحقق 88.6% على SWE-bench Verified وهو الخيار العملي؛ تضخّم المعايير يجعل الدرجات الخام صعبة التصديق.”

developer leaderboardاقرأ النص الأصلي ↗

انشر

الخلاصة

في 23 فبراير 2026 شرح فريق التقييمات الرائدة في OpenAI سبب توقفه عن الإبلاغ بدرجة SWE-bench Verified: وجد تدقيق أن 59.4% من أصعب المسائل تحوي حالات اختبار معطوبة جوهرياً أو غير قابلة للحل، أي اختبارات تمرّ حتى دون إصلاح العلة الأساسية، بما يعني تضخماً بمقدار 5-15 نقطة على نماذج ما بعد 2023. وتقوّض النتيجة أرقام البرمجة البارزة التي تستشهد بها المختبرات (أنثروبيك Opus 4.8 عند 88.6%، وFable 5 المعلّق عند 95.0%، وجوجل ديب مايند Gemini قرب 80%). وتسرّع تحوّلاً نحو معايير إتمام المهام والتكلفة لكل مهمة ووكلاء البرمجة (Terminal-Bench) بدلاً من المجموعات الثابتة، وتغذّي «فجوة التقييم» مع تنامي وعي النماذج بموقفها أثناء الاختبارات.

بالأرقام

  • 59.4%، أصعب مهام SWE-bench ذات اختبارات معطوبة/غير قابلة للحل.
  • 5-15 نقطة، التضخم المقدّر على نماذج ما بعد 2023.
  • 23 فبراير 2026، إفصاح OpenAI.
  • 88.6%، درجة Opus 4.8 على SWE-bench Verified (باتت مشكوكاً فيها الآن).
  • 95.0%، درجة Fable 5 (النموذج معلّق).

لماذا يهم

إذا كان المعيار الرائد للبرمجة في المجال معطوباً، فإن تصنيفات القدرات العامة التي تسوّقها المختبرات ويسعّرها المستثمرون تصبح غير موثوقة. ويدفع ذلك التقييم نحو مهام وكيلية أصعب على التلاعب، ويقوّي الحجة بأن النماذج تتعلّم استغلال آثار التقييم بدلاً من حلّ المشكلات.

ما ينبغي مراقبته

  • هل تعيد أنثروبيك وجوجل ذكر أرقامها على SWE-bench أو تدافع عنها.
  • تبنّي Terminal-Bench / التكلفة لكل مهمة كمعيار جديد.
  • SWE-bench مُصلَّح أو معيار خلَف له.

الموجز، عبر البريد