Story
OpenAI ถอนคำแนะนำ SWE-Bench Pro หลังพบข้อบกพร่องในแบบทดสอบเขียนโค้ด AI

Summary
OpenAI ประกาศถอนคำแนะนำให้ใช้ SWE-Bench Pro เป็นมาตรฐานวัดความสามารถในการเขียนโค้ดของ AI หลังการตรวจสอบภายในพบว่าราวหนึ่งในสามของแบบทดสอบมีข้อบกพร่องในการออกแบบ ซึ่งทำให้ผลลัพธ์ที่ได้บิดเบือน
OpenAI ได้ประกาศว่าจะไม่แนะนำให้ใช้ SWE-Bench Pro เป็นแบบทดสอบที่เชื่อถือได้สำหรับวัดความสามารถในการเขียนโค้ดของปัญญาประดิษฐ์ (AI) อีกต่อไป การตัดสินใจนี้เกิดขึ้นหลังจากการตรวจสอบภายในพบว่าประมาณ 30% ของชุดข้อสอบในแบบทดสอบดังกล่าวมีข้อบกพร่องในการออกแบบ ซึ่งอาจทำให้ผลการประเมินความสามารถของ AI คลาดเคลื่อน
จากการตรวจสอบชุดข้อสอบสาธารณะจำนวน 731 รายการ พบว่าแบบทดสอบได้มาถึงจุดอิ่มตัวใกล้เพดานความคลาดเคลื่อน (noise ceiling) ที่ 70% โดยไปป์ไลน์การวิเคราะห์ข้อมูลของบริษัทพบข้อผิดพลาดใน 27.4% ของชุดข้อสอบ ขณะที่ผู้ตรวจสอบที่เป็นมนุษย์ซึ่งเป็นวิศวกรซอฟต์แวร์ที่มีประสบการณ์ ระบุปัญหาใน 34.1% ของชุดข้อสอบ
OpenAI ได้จำแนกปัญหาที่พบออกเป็น 4 ประเภทหลัก ได้แก่ การทดสอบที่เข้มงวดเกินไปซึ่งปฏิเสธโค้ดที่ทำงานได้ถูกต้อง, คำสั่งที่ไม่ชัดเจนซึ่งละเลยข้อกำหนดที่จำเป็นแต่ถูกบังคับใช้ในการทดสอบที่ซ่อนอยู่, การทดสอบที่ไม่ครอบคลุมซึ่งทำให้โค้ดที่ไม่สมบูรณ์สามารถผ่านได้ และคำสั่งที่ทำให้เข้าใจผิดซึ่งชี้แนะให้โมเดล AI สร้างโค้ดที่ไม่ถูกต้อง
Adบริษัทชี้แจงว่าปัญหาเหล่านี้ส่วนหนึ่งเกิดจากกระบวนการรวบรวมข้อสอบของ SWE-Bench Pro ซึ่งดึงข้อมูลจากการเปลี่ยนแปลงฟีเจอร์ในคลังโค้ด (code repositories) โดยอัตโนมัติ ทำให้คำอธิบายปัญหา โค้ด และการทดสอบไม่สอดคล้องกันเสมอไป ก่อนหน้านี้ OpenAI เคยตรวจสอบ SWE-bench Verified และพบปัญหาด้านการออกแบบเช่นกัน ซึ่งทำให้หันมาแนะนำ SWE-Bench Pro เป็นทางเลือกแทน
OpenAI ย้ำว่าข้อบกพร่องในการประเมินผลกระทบต่อความเข้าใจในขีดความสามารถที่แท้จริงของโมเดล AI และอาจนำไปสู่การประเมินกรณีด้านความปลอดภัยที่ผิดพลาด รวมถึงส่งผลต่อการจัดลำดับความสำคัญของงานวิจัยภายใต้กรอบการเตรียมความพร้อม (Preparedness Framework) ของบริษัท