Story

ओपनएआई ने SWE-Bench Pro कोडिंग बेंचमार्क की सिफ़ारिश वापस ली

ENTHMSVIIDZHZH-TWJAKOHI
Jul 8, 20261 min read
ओपनएआई ने SWE-Bench Pro कोडिंग बेंचमार्क की सिफ़ारिश वापस ली

Summary

एक आंतरिक ऑडिट में डिज़ाइन संबंधी महत्वपूर्ण खामियां पाए जाने के बाद, ओपनएआई ने एआई कोडिंग क्षमताओं को मापने के लिए SWE-Bench Pro की अपनी सिफ़ारिश वापस ले ली है। कंपनी के अनुसार, बेंचमार्क के लगभग 30% कार्यों में ऐसी समस्याएं हैं जो परिणामों को विकृत करती हैं।

Text size
Background

ओपनएआई ने घोषणा की है कि वह अब आर्टिफिशियल इंटेलिजेंस (एआई) की कोडिंग क्षमता के विश्वसनीय माप के रूप में SWE-Bench Pro की सिफ़ारिश नहीं करता है। यह निर्णय एक आंतरिक ऑडिट के बाद लिया गया, जिसमें पाया गया कि बेंचमार्क के लगभग 30% कार्यों में डिज़ाइन संबंधी खामियां हैं जो परिणामों को गलत तरीके से प्रस्तुत करती हैं। कंपनी ने अनुसंधान समुदाय से इस मूल्यांकन को एक प्रमुख कोडिंग बेंचमार्क के रूप में उपयोग न करने का आग्रह किया है।

ऑडिट में मॉडल-आधारित जांच एजेंटों और पांच अनुभवी सॉफ्टवेयर इंजीनियरों द्वारा SWE-Bench Pro के 731 सार्वजनिक कार्यों की जांच की गई। ओपनएआई के विश्लेषण में 27.4% कार्यों को त्रुटिपूर्ण पाया गया, जबकि मानव समीक्षकों ने 34.1% कार्यों में समस्याएं पहचानीं।

कंपनी के अनुसार, ये समस्याएं मुख्य रूप से चार श्रेणियों में आती हैं: अत्यधिक सख्त परीक्षण जो सही समाधानों को भी अस्वीकार कर देते हैं, अधूरी जानकारी वाले प्रॉम्प्ट, कम कवरेज वाले परीक्षण जो अधूरे समाधानों को पास होने देते हैं, और भ्रामक प्रॉम्प्ट जो मॉडल को गलत दिशा में ले जाते हैं। इन खामियों के कारण, कई बार सही समाधान भी छिपी हुई आवश्यकताओं या अधूरे मूल्यांकन मानदंडों के कारण विफल हो जाते हैं।

Sample IUX Markets – In-articleAd

ओपनएआई ने यह भी कहा कि बेंचमार्क एक "संतृप्ति बिंदु" पर पहुंच गया है, जहां आठ महीनों में अग्रणी मॉडलों की सफलता दर 23.3% से बढ़कर 80.3% हो गई है। कंपनी ने पहले SWE-bench Verified में भी समस्याएं पाई थीं, जिसके बाद SWE-Bench Pro को एक विकल्प के रूप में सुझाया गया था।

कंपनी ने इस बात पर जोर दिया कि मूल्यांकन में इस तरह की खामियां मॉडल की वास्तविक क्षमताओं की समझ को प्रभावित कर सकती हैं। यह उनके 'प्रिपेयर्डनेस फ्रेमवर्क' के तहत सुरक्षा मामलों और अनुसंधान प्राथमिकताओं को भी गलत तरीके से प्रस्तुत कर सकता है।

Back to latest news

LATEST