Story

OpenAI Merilis Tolok Ukur untuk Mengevaluasi Respons Model AI dalam Skenario Kesehatan Mental

ENTHMSVIIDZHZH-TWJAKOHI
Sep 23, 20262 min read
OpenAI Merilis Tolok Ukur untuk Mengevaluasi Respons Model AI dalam Skenario Kesehatan Mental

Summary

OpenAI telah meluncurkan MentalHealthBench, sebuah kerangka kerja sumber terbuka yang dikembangkan bersama para ahli berlisensi untuk menilai kualitas dan keamanan respons yang dihasilkan AI dalam percakapan tentang kesehatan mental. Perusahaan ini juga menerbitkan skor awal untuk beberapa model bahasa besar berdasarkan standar baru tersebut.

Text size
Background

OpenAI pada hari Rabu merilis MentalHealthBench, sebuah benchmark open-source baru yang dirancang untuk mengevaluasi kinerja model AI dalam percakapan kesehatan mental yang realistis. Kerangka kerja ini dikembangkan bekerja sama dengan lebih dari 80 pakar kesehatan mental berlisensi dari 22 negara untuk menstandarisasi penilaian kemampuan AI di domain yang sensitif ini.

Struktur dan Kinerja Benchmark

MentalHealthBench menilai model AI berdasarkan perilaku kunci seperti keselamatan, pencarian konteks, menjaga otonomi pengguna, dan memberikan panduan yang dapat ditindaklanjuti. Menurut OpenAI, benchmark ini terdiri dari berbagai skenario:

  • 53,5% melibatkan percakapan sehari-hari yang tidak akut.
  • 28,3% mensimulasikan keadaan darurat dengan masalah keselamatan yang mendesak.
  • 18,2% mencakup percakapan dengan tingkat keparahan tinggi yang menunjukkan masalah kesehatan mental yang serius.

OpenAI mengevaluasi beberapa model AI terhadap benchmark ini, dengan model GPT-5.6 Sol miliknya sendiri berfungsi sebagai penilai otomatis berdasarkan kriteria yang ditentukan oleh para ahli. Perusahaan melaporkan bahwa GPT-6 Astra mencapai skor tertinggi sebesar 57,3%, diikuti oleh GPT-6 Sol sebesar 53,9% dan Claude Opus 5.5 sebesar 52,4%.

Kriteria Evaluasi yang Dipimpin Pakar

Sample IUX Markets – In-articleAd

Sistem evaluasi dibangun berdasarkan rubrik terperinci yang dibuat oleh para ahli kesehatan mental yang berpartisipasi, dengan setiap skenario ditinjau oleh setidaknya tiga profesional. Kriteria diberi bobot dari -10 hingga +10 berdasarkan kepentingan klinis untuk menilai respons model.

Dalam analisis terpisah yang melibatkan 44 orang dewasa yang telah menggunakan AI untuk dukungan kesehatan mental, OpenAI menemukan bahwa pengguna menghargai langkah-langkah praktis selanjutnya dan nada yang tepat. Sebaliknya, para ahli klinis lebih menekankan pada kemampuan AI untuk mengumpulkan konteks yang relevan dan menafsirkan situasi yang ambigu dengan benar. Kriteria penilaian akhir untuk tolok ukur didasarkan pada konsensus para ahli.

Konteks dan Langkah-Langkah Keamanan yang Lebih Luas

Peluncuran MentalHealthBench merupakan bagian dari upaya yang lebih luas oleh OpenAI untuk meningkatkan keamanan dalam produk-produknya. Perusahaan tersebut menyatakan bahwa mereka juga telah memperkuat respons ChatGPT dalam percakapan sensitif, memperluas akses ke sumber daya krisis, dan memperkenalkan fitur baru seperti opsi "Kontak Tepercaya" dan "ChatGPT khusus untuk Remaja" dengan perlindungan tambahan. Dengan membuka tolok ukur ini bagi para peneliti, OpenAI bertujuan untuk mendorong pengembangan dan pengawasan lebih lanjut di bidang AI untuk kesehatan mental.

Back to latest news

LATEST