Story

OpenAI, 코딩 벤치마크 'SWE-Bench Pro' 추천 철회... "약 30% 결함 발견"

ENTHMSVIIDZHZH-TWJAKOHI
Jul 8, 20261 min read
OpenAI, 코딩 벤치마크 'SWE-Bench Pro' 추천 철회... "약 30% 결함 발견"

Summary

OpenAI가 AI 코딩 능력 평가 벤치마크인 'SWE-Bench Pro'에 대한 추천을 철회한다고 발표했습니다. 내부 감사 결과, 벤치마크 과제의 약 30%에서 평가 결과를 왜곡하는 심각한 설계 결함이 발견되었습니다.

Text size
Background

OpenAI가 인공지능(AI) 코딩 능력 측정을 위한 신뢰성 있는 척도로 권장해 온 'SWE-Bench Pro'에 대한 추천을 철회한다고 밝혔습니다. 이번 결정은 내부 감사 결과, 벤치마크 과제의 약 30%에서 결과의 신뢰도를 떨어뜨리는 설계상 결함이 포함된 것으로 드러난 데 따른 것입니다.

감사는 모델 기반 조사와 5명의 숙련된 소프트웨어 엔지니어의 독립적인 검토로 진행되었습니다. 그 결과, 전체 공개 과제 731개 중 모델은 27.4%(200개), 인간 검토자는 34.1%(249개)에서 문제를 식별했습니다. OpenAI는 최신 모델들의 통과율이 8개월 만에 23.3%에서 80.3%로 급증했으며, 벤치마크가 약 70%의 '노이즈 실링(noise ceiling)'에 도달해 포화 상태에 이르렀다고 분석했습니다.

발견된 문제들은 주로 네 가지 유형으로 분류됩니다. ▲요구사항에 명시되지 않은 세부 구현까지 강제해 정상적인 해결책을 거부하는 '지나치게 엄격한 테스트' ▲숨겨진 테스트가 요구하는 조건을 프롬프트에서 누락한 '불충분한 명세' ▲요청된 기능을 제대로 확인하지 못해 불완전한 수정안이 통과되는 '낮은 커버리지 테스트' ▲모델을 잘못된 방향으로 유도하거나 테스트 요구사항과 모순되는 '오해의 소지가 있는 프롬프트' 등입니다.

Sample IUX Markets – In-articleAd

OpenAI는 이러한 평가상의 결함이 AI 모델의 실제 역량에 대한 이해를 저해하고, 자사의 '대비 프레임워크(Preparedness Framework)' 하에서 안전성 평가 및 연구 우선순위를 왜곡할 수 있다고 우려를 표했습니다. 회사는 이전에 또 다른 벤치마크인 'SWE-bench Verified'의 문제점을 지적하며 대안으로 SWE-Bench Pro를 추천한 바 있습니다.

Back to latest news

LATEST