Story
OpenAI撤回SWE-Bench Pro編碼基準推薦 指近三成任務存設計瑕疵

Summary
OpenAI宣布,由於內部審計發現近三分之一的任務存在設計瑕疵,可能扭曲結果,因此不再推薦使用SWE-Bench Pro作為衡量AI編碼能力的可靠基準。該公司已撤回先前對研究社群的推薦。
人工智慧研究公司OpenAI宣布,經過內部審計發現,其先前推薦的AI編碼能力基準測試SWE-Bench Pro中,約有30%的任務存在設計瑕疵,會導致評估結果失真。因此,該公司正式撤回先前向研究社群發出的建議,不再推薦使用此基準作為衡量模型編碼能力的主要指標。
根據OpenAI的說法,此次審計動用了基於模型的調查代理程式,並由五位經驗豐富的軟體工程師進行獨立審查,檢視了SWE-Bench Pro公開的731項任務。報告指出,自動化分析流程標記出27.4%的任務有問題,而人工審查員則在34.1%的任務中發現瑕疵。該公司亦表示,此基準已接近飽和點,頂尖模型在八個月內通過率從23.3%躍升至80.3%,顯示其評估能力可能已達極限。
OpenAI將發現的問題歸納為四大類:第一是「測試過於嚴格」,會拒絕功能上正確但實作細節不符的解決方案;第二是「提示說明不足」,遺漏了隱藏測試所要求的必要條件;第三是「測試覆蓋率低」,未能充分檢驗要求的功能,導致不完整的修復方案也能通過;第四則是「提示具誤導性」,引導模型產生錯誤行為,或與測試要求相矛盾。
Ad報告補充說明,SWE-Bench Pro的任務是透過程式化方式從公開及私有的程式碼儲存庫中擷取,因此問題描述、合併的程式碼與單元測試之間未必能完美對應。值得注意的是,OpenAI先前曾因發現另一基準SWE-bench Verified存在根本性問題,轉而推薦SWE-Bench Pro作為替代方案。
OpenAI強調,評估基準的瑕疵會影響對模型能力的準確理解,並可能在公司的「準備框架」(Preparedness Framework)下,誤導安全評估與研究的優先順序。這類問題凸顯了建立可靠且嚴謹的AI評估工具所面臨的挑戰。