Story
OpenAI Merilis Tolok Ukur untuk Mengevaluasi Respons Model AI dalam Skenario Kesehatan Mental

Summary
OpenAI telah meluncurkan MentalHealthBench, sebuah kerangka kerja sumber terbuka yang dikembangkan bersama para ahli berlisensi untuk menilai kualitas dan keamanan respons yang dihasilkan AI dalam percakapan tentang kesehatan mental. Perusahaan ini juga menerbitkan skor awal untuk beberapa model bahasa besar berdasarkan standar baru tersebut.
OpenAI pada hari Rabu merilis MentalHealthBench, sebuah benchmark open-source baru yang dirancang untuk mengevaluasi kinerja model AI dalam percakapan kesehatan mental yang realistis. Kerangka kerja ini dikembangkan bekerja sama dengan lebih dari 80 pakar kesehatan mental berlisensi dari 22 negara untuk menstandarisasi penilaian kemampuan AI di domain yang sensitif ini.
Struktur dan Kinerja Benchmark
MentalHealthBench menilai model AI berdasarkan perilaku kunci seperti keselamatan, pencarian konteks, menjaga otonomi pengguna, dan memberikan panduan yang dapat ditindaklanjuti. Menurut OpenAI, benchmark ini terdiri dari berbagai skenario:
- 53,5% melibatkan percakapan sehari-hari yang tidak akut.
- 28,3% mensimulasikan keadaan darurat dengan masalah keselamatan yang mendesak.
- 18,2% mencakup percakapan dengan tingkat keparahan tinggi yang menunjukkan masalah kesehatan mental yang serius.
OpenAI mengevaluasi beberapa model AI terhadap benchmark ini, dengan model GPT-5.6 Sol miliknya sendiri berfungsi sebagai penilai otomatis berdasarkan kriteria yang ditentukan oleh para ahli. Perusahaan melaporkan bahwa GPT-6 Astra mencapai skor tertinggi sebesar 57,3%, diikuti oleh GPT-6 Sol sebesar 53,9% dan Claude Opus 5.5 sebesar 52,4%.
Kriteria Evaluasi yang Dipimpin Pakar
AdSistem evaluasi dibangun berdasarkan rubrik terperinci yang dibuat oleh para ahli kesehatan mental yang berpartisipasi, dengan setiap skenario ditinjau oleh setidaknya tiga profesional. Kriteria diberi bobot dari -10 hingga +10 berdasarkan kepentingan klinis untuk menilai respons model.
Dalam analisis terpisah yang melibatkan 44 orang dewasa yang telah menggunakan AI untuk dukungan kesehatan mental, OpenAI menemukan bahwa pengguna menghargai langkah-langkah praktis selanjutnya dan nada yang tepat. Sebaliknya, para ahli klinis lebih menekankan pada kemampuan AI untuk mengumpulkan konteks yang relevan dan menafsirkan situasi yang ambigu dengan benar. Kriteria penilaian akhir untuk tolok ukur didasarkan pada konsensus para ahli.
Konteks dan Langkah-Langkah Keamanan yang Lebih Luas
Peluncuran MentalHealthBench merupakan bagian dari upaya yang lebih luas oleh OpenAI untuk meningkatkan keamanan dalam produk-produknya. Perusahaan tersebut menyatakan bahwa mereka juga telah memperkuat respons ChatGPT dalam percakapan sensitif, memperluas akses ke sumber daya krisis, dan memperkenalkan fitur baru seperti opsi "Kontak Tepercaya" dan "ChatGPT khusus untuk Remaja" dengan perlindungan tambahan. Dengan membuka tolok ukur ini bagi para peneliti, OpenAI bertujuan untuk mendorong pengembangan dan pengawasan lebih lanjut di bidang AI untuk kesehatan mental.