Story

OpenAI Cabut Rekomendasi Tolok Ukur Pengodean SWE-Bench Pro

ENTHMSVIIDZHZH-TWJAKOHI
Jul 8, 20261 min read
OpenAI Cabut Rekomendasi Tolok Ukur Pengodean SWE-Bench Pro

Summary

OpenAI mengumumkan tidak lagi merekomendasikan SWE-Bench Pro sebagai tolok ukur kemampuan pengodean AI setelah audit internal menemukan kelemahan desain yang signifikan pada sekitar sepertiga tugasnya. Perusahaan kini menarik kembali rekomendasi sebelumnya bagi komunitas riset untuk menggunakan evaluasi tersebut.

Text size
Background

OpenAI menyatakan tidak lagi merekomendasikan SWE-Bench Pro sebagai ukuran yang andal untuk kemampuan pengodean kecerdasan buatan (AI). Keputusan ini diambil setelah audit internal menemukan bahwa sekitar 30% dari tugas dalam tolok ukur tersebut mengandung kelemahan desain yang mendistorsi hasil. Akibatnya, perusahaan menarik kembali rekomendasi sebelumnya kepada komunitas riset untuk menggunakan evaluasi ini sebagai tolok ukur pengodean terkemuka.

Audit tersebut memeriksa 731 tugas publik dari SWE-Bench Pro menggunakan agen penyelidik berbasis model dan tinjauan independen dari lima insinyur perangkat lunak berpengalaman. Analisis data perusahaan menandai 200 tugas (27,4%) sebagai bermasalah, sementara peninjau manusia mengidentifikasi masalah pada 249 tugas (34,1%). OpenAI juga mencatat bahwa tolok ukur ini telah mencapai "titik jenuh", dengan performa model yang meningkat pesat dari tingkat kelulusan 23,3% menjadi 80,3% hanya dalam delapan bulan.

Menurut OpenAI, masalah yang ditemukan terbagi dalam empat kategori utama. Kategori tersebut meliputi: pengujian yang terlalu ketat yang menolak solusi yang secara fungsional benar, perintah yang kurang spesifik yang tidak menyertakan persyaratan yang diuji secara tersembunyi, pengujian dengan cakupan rendah yang memungkinkan perbaikan tidak lengkap untuk lolos, serta perintah yang menyesatkan yang mengarahkan model ke perilaku yang salah.

Sample IUX Markets – In-articleAd

Perusahaan menjelaskan bahwa solusi yang benar terkadang gagal karena adanya persyaratan tersembunyi, instruksi yang kontradiktif, atau kriteria penilaian yang tidak lengkap. Tugas-tugas dalam SWE-Bench Pro bersumber secara terprogram dari repositori kode, di mana deskripsi masalah, kode, dan pengujian unit tidak selalu selaras. Sebelumnya, OpenAI merekomendasikan SWE-Bench Pro sebagai alternatif dari SWE-bench Verified, yang juga ditemukan memiliki masalah desain fundamental.

OpenAI menekankan bahwa kelemahan dalam evaluasi dapat memengaruhi pemahaman tentang kapabilitas model AI. Hal ini juga dapat memberikan gambaran yang keliru mengenai kasus keamanan dan prioritas riset di bawah Kerangka Kesiapsiagaan (Preparedness Framework) milik perusahaan.

Back to latest news

LATEST