Story
ओपनएआई ने SWE-Bench Pro कोडिंग बेंचमार्क की सिफ़ारिश वापस ली

Summary
एक आंतरिक ऑडिट में डिज़ाइन संबंधी महत्वपूर्ण खामियां पाए जाने के बाद, ओपनएआई ने एआई कोडिंग क्षमताओं को मापने के लिए SWE-Bench Pro की अपनी सिफ़ारिश वापस ले ली है। कंपनी के अनुसार, बेंचमार्क के लगभग 30% कार्यों में ऐसी समस्याएं हैं जो परिणामों को विकृत करती हैं।
ओपनएआई ने घोषणा की है कि वह अब आर्टिफिशियल इंटेलिजेंस (एआई) की कोडिंग क्षमता के विश्वसनीय माप के रूप में SWE-Bench Pro की सिफ़ारिश नहीं करता है। यह निर्णय एक आंतरिक ऑडिट के बाद लिया गया, जिसमें पाया गया कि बेंचमार्क के लगभग 30% कार्यों में डिज़ाइन संबंधी खामियां हैं जो परिणामों को गलत तरीके से प्रस्तुत करती हैं। कंपनी ने अनुसंधान समुदाय से इस मूल्यांकन को एक प्रमुख कोडिंग बेंचमार्क के रूप में उपयोग न करने का आग्रह किया है।
ऑडिट में मॉडल-आधारित जांच एजेंटों और पांच अनुभवी सॉफ्टवेयर इंजीनियरों द्वारा SWE-Bench Pro के 731 सार्वजनिक कार्यों की जांच की गई। ओपनएआई के विश्लेषण में 27.4% कार्यों को त्रुटिपूर्ण पाया गया, जबकि मानव समीक्षकों ने 34.1% कार्यों में समस्याएं पहचानीं।
कंपनी के अनुसार, ये समस्याएं मुख्य रूप से चार श्रेणियों में आती हैं: अत्यधिक सख्त परीक्षण जो सही समाधानों को भी अस्वीकार कर देते हैं, अधूरी जानकारी वाले प्रॉम्प्ट, कम कवरेज वाले परीक्षण जो अधूरे समाधानों को पास होने देते हैं, और भ्रामक प्रॉम्प्ट जो मॉडल को गलत दिशा में ले जाते हैं। इन खामियों के कारण, कई बार सही समाधान भी छिपी हुई आवश्यकताओं या अधूरे मूल्यांकन मानदंडों के कारण विफल हो जाते हैं।
Adओपनएआई ने यह भी कहा कि बेंचमार्क एक "संतृप्ति बिंदु" पर पहुंच गया है, जहां आठ महीनों में अग्रणी मॉडलों की सफलता दर 23.3% से बढ़कर 80.3% हो गई है। कंपनी ने पहले SWE-bench Verified में भी समस्याएं पाई थीं, जिसके बाद SWE-Bench Pro को एक विकल्प के रूप में सुझाया गया था।
कंपनी ने इस बात पर जोर दिया कि मूल्यांकन में इस तरह की खामियां मॉडल की वास्तविक क्षमताओं की समझ को प्रभावित कर सकती हैं। यह उनके 'प्रिपेयर्डनेस फ्रेमवर्क' के तहत सुरक्षा मामलों और अनुसंधान प्राथमिकताओं को भी गलत तरीके से प्रस्तुत कर सकता है।