Story
OpenAI rút lại khuyến nghị về bộ benchmark lập trình SWE-Bench Pro

Summary
OpenAI đã rút lại khuyến nghị sử dụng SWE-Bench Pro làm thước đo khả năng lập trình của AI sau khi một cuộc kiểm tra nội bộ phát hiện gần 30% các tác vụ của bộ benchmark này có sai sót trong thiết kế, làm sai lệch kết quả.
OpenAI thông báo không còn khuyến nghị SWE-Bench Pro là một thước đo đáng tin cậy cho khả năng lập trình của AI. Quyết định này được đưa ra sau khi một cuộc kiểm tra nội bộ phát hiện khoảng 30% các tác vụ trong bộ benchmark này chứa các sai sót thiết kế làm sai lệch kết quả. Công ty cho biết đang rút lại khuyến nghị trước đây về việc cộng đồng nghiên cứu nên sử dụng bộ đánh giá này làm tiêu chuẩn hàng đầu về lập trình.
Cuộc kiểm tra đã phân tích 731 tác vụ công khai của SWE-Bench Pro bằng cách sử dụng các tác nhân điều tra dựa trên mô hình và các đánh giá độc lập từ năm kỹ sư phần mềm giàu kinh nghiệm. OpenAI cho biết bộ benchmark đã đạt đến điểm bão hòa gần "ngưỡng nhiễu 70%", với tỷ lệ thành công của các mô hình tiên tiến đã cải thiện từ 23,3% lên 80,3% chỉ trong tám tháng. Quá trình phân tích dữ liệu của công ty đã gắn cờ 27,4% tác vụ là có vấn đề, trong khi các chuyên gia đánh giá con người đã xác định các vấn đề trong 34,1% tác vụ.
Theo OpenAI, các vấn đề được chia thành bốn loại chính: các bài kiểm tra quá khắt khe, các yêu cầu không được chỉ định rõ ràng, các bài kiểm tra có độ bao phủ thấp và các yêu cầu gây hiểu lầm. Những sai sót này có thể khiến các giải pháp đúng về mặt chức năng bị đánh giá là thất bại do các yêu cầu ẩn, hướng dẫn mâu thuẫn, tiêu chí kiểm tra quá nghiêm ngặt hoặc tiêu chí chấm điểm không đầy đủ.
AdOpenAI lưu ý rằng các tác vụ của SWE-Bench Pro được lấy một cách có lập trình từ các thay đổi tính năng trong các kho mã nguồn công khai và riêng tư, nơi mô tả vấn đề, mã nguồn và các bài kiểm tra không phải lúc nào cũng thống nhất để tạo thành các tác vụ đánh giá rõ ràng. Trước đây, công ty đã từng phát hiện các vấn đề trong bộ benchmark SWE-bench Verified và đã đề xuất SWE-Bench Pro như một giải pháp thay thế.
Công ty nhấn mạnh rằng những sai sót trong các bộ benchmark có thể ảnh hưởng đến sự hiểu biết về khả năng thực sự của các mô hình AI. Điều này có thể dẫn đến việc đánh giá sai các trường hợp an toàn và định hướng sai các ưu tiên nghiên cứu theo Khuôn khổ Sẵn sàng (Preparedness Framework) của OpenAI.