Story

OpenAI ถอนคำแนะนำ SWE-Bench Pro หลังพบข้อบกพร่องในแบบทดสอบเขียนโค้ด AI

ENTHMSVIIDZHZH-TWJAKOHI
Jul 8, 20261 min read
OpenAI ถอนคำแนะนำ SWE-Bench Pro หลังพบข้อบกพร่องในแบบทดสอบเขียนโค้ด AI

Summary

OpenAI ประกาศถอนคำแนะนำให้ใช้ SWE-Bench Pro เป็นมาตรฐานวัดความสามารถในการเขียนโค้ดของ AI หลังการตรวจสอบภายในพบว่าราวหนึ่งในสามของแบบทดสอบมีข้อบกพร่องในการออกแบบ ซึ่งทำให้ผลลัพธ์ที่ได้บิดเบือน

Text size
Background

OpenAI ได้ประกาศว่าจะไม่แนะนำให้ใช้ SWE-Bench Pro เป็นแบบทดสอบที่เชื่อถือได้สำหรับวัดความสามารถในการเขียนโค้ดของปัญญาประดิษฐ์ (AI) อีกต่อไป การตัดสินใจนี้เกิดขึ้นหลังจากการตรวจสอบภายในพบว่าประมาณ 30% ของชุดข้อสอบในแบบทดสอบดังกล่าวมีข้อบกพร่องในการออกแบบ ซึ่งอาจทำให้ผลการประเมินความสามารถของ AI คลาดเคลื่อน

จากการตรวจสอบชุดข้อสอบสาธารณะจำนวน 731 รายการ พบว่าแบบทดสอบได้มาถึงจุดอิ่มตัวใกล้เพดานความคลาดเคลื่อน (noise ceiling) ที่ 70% โดยไปป์ไลน์การวิเคราะห์ข้อมูลของบริษัทพบข้อผิดพลาดใน 27.4% ของชุดข้อสอบ ขณะที่ผู้ตรวจสอบที่เป็นมนุษย์ซึ่งเป็นวิศวกรซอฟต์แวร์ที่มีประสบการณ์ ระบุปัญหาใน 34.1% ของชุดข้อสอบ

OpenAI ได้จำแนกปัญหาที่พบออกเป็น 4 ประเภทหลัก ได้แก่ การทดสอบที่เข้มงวดเกินไปซึ่งปฏิเสธโค้ดที่ทำงานได้ถูกต้อง, คำสั่งที่ไม่ชัดเจนซึ่งละเลยข้อกำหนดที่จำเป็นแต่ถูกบังคับใช้ในการทดสอบที่ซ่อนอยู่, การทดสอบที่ไม่ครอบคลุมซึ่งทำให้โค้ดที่ไม่สมบูรณ์สามารถผ่านได้ และคำสั่งที่ทำให้เข้าใจผิดซึ่งชี้แนะให้โมเดล AI สร้างโค้ดที่ไม่ถูกต้อง

Sample IUX Markets – In-articleAd

บริษัทชี้แจงว่าปัญหาเหล่านี้ส่วนหนึ่งเกิดจากกระบวนการรวบรวมข้อสอบของ SWE-Bench Pro ซึ่งดึงข้อมูลจากการเปลี่ยนแปลงฟีเจอร์ในคลังโค้ด (code repositories) โดยอัตโนมัติ ทำให้คำอธิบายปัญหา โค้ด และการทดสอบไม่สอดคล้องกันเสมอไป ก่อนหน้านี้ OpenAI เคยตรวจสอบ SWE-bench Verified และพบปัญหาด้านการออกแบบเช่นกัน ซึ่งทำให้หันมาแนะนำ SWE-Bench Pro เป็นทางเลือกแทน

OpenAI ย้ำว่าข้อบกพร่องในการประเมินผลกระทบต่อความเข้าใจในขีดความสามารถที่แท้จริงของโมเดล AI และอาจนำไปสู่การประเมินกรณีด้านความปลอดภัยที่ผิดพลาด รวมถึงส่งผลต่อการจัดลำดับความสำคัญของงานวิจัยภายใต้กรอบการเตรียมความพร้อม (Preparedness Framework) ของบริษัท

Back to latest news

LATEST