Story
因发现设计缺陷,OpenAI撤回对SWE-Bench Pro编码基准的推荐

Summary
人工智能公司OpenAI宣布,由于内部审计发现SWE-Bench Pro编码基准中约30%的任务存在设计缺陷,该公司将撤回此前对该基准的推荐。这些缺陷会扭曲对人工智能编码能力的评估结果。
Text size
Background
OpenAI近日表示,该公司将不再推荐使用SWE-Bench Pro作为衡量人工智能编码能力的可靠基准。此前,一项内部审计发现,该基准中约有30%的任务包含设计缺陷,这些缺陷会严重影响评估结果的准确性。
该审计审查了SWE-Bench Pro公开的731项任务,并结合了基于模型的调查代理和五名经验丰富的软件工程师的独立审查。OpenAI指出,该基准已接近70%的“噪音上限”饱和点,顶尖模型在八个月内通过率从23.3%飙升至80.3%。数据分析发现27.4%的任务存在问题,而人工审查员则在34.1%的任务中发现了问题。
根据OpenAI的说法,这些问题主要分为四类:测试过于严格,会拒绝功能上正确但实现细节不符的解决方案;提示不明确,省略了隐藏测试所要求的必要条件;测试覆盖率低,未能充分检查所需功能,导致不完整的修复方案也能通过;以及提示具有误导性,引导模型采取错误行为或与测试要求相矛盾。
AdOpenAI解释称,SWE-Bench Pro的任务是通过编程方式从公共和私人代码库的特性变更中获取的,这导致问题描述、合并代码和单元测试之间并不总能形成清晰的评估任务。此前,该公司曾因发现“SWE-bench Verified”基准存在根本性设计问题而推荐使用SWE-Bench Pro作为替代方案。OpenAI强调,评估中的缺陷会影响对模型能力的理解,并可能误导其“准备框架”下的安全案例和研究重点。