Story

OpenAI Mengeluarkan Penanda Aras untuk Menilai Respons Model AI dalam Senario Kesihatan Mental

ENTHMSVIIDZHZH-TWJAKOHI
Sep 23, 20262 min read
OpenAI Mengeluarkan Penanda Aras untuk Menilai Respons Model AI dalam Senario Kesihatan Mental

Summary

OpenAI telah melancarkan MentalHealthBench, rangka kerja sumber terbuka yang dibangunkan dengan pakar berlesen untuk menilai kualiti dan keselamatan respons yang dijana AI dalam perbualan kesihatan mental. Syarikat itu juga menerbitkan skor awal untuk beberapa model bahasa besar berbanding piawaian baharu.

Text size
Background

OpenAI pada hari Rabu telah mengeluarkan MentalHealthBench, penanda aras sumber terbuka baharu yang direka untuk menilai prestasi model AI dalam perbualan kesihatan mental yang realistik. Rangka kerja ini dibangunkan dengan kerjasama lebih 80 pakar kesihatan mental berlesen dari 22 negara untuk menyeragamkan penilaian keupayaan AI dalam domain sensitif ini.

Struktur dan Prestasi Penanda Aras

MentalHealthBench menilai model AI mengenai tingkah laku utama seperti keselamatan, mencari konteks, memelihara agensi pengguna dan menyediakan panduan yang boleh diambil tindakan. Menurut OpenAI, penanda aras ini terdiri daripada pelbagai senario:

  • 53.5% melibatkan perbualan harian yang tidak akut.
  • 28.3% mensimulasikan kecemasan dengan kebimbangan keselamatan segera.
  • 18.2% merangkumi perbualan ketajaman tinggi yang menunjukkan masalah kesihatan mental yang serius.

OpenAI menilai beberapa model AI berbanding penanda aras, dengan model GPT-5.6 Solnya sendiri berfungsi sebagai penggredan automatik berbanding kriteria yang ditentukan oleh pakar. Syarikat itu melaporkan bahawa GPT-6 Astra mencapai skor tertinggi pada 57.3%, diikuti oleh GPT-6 Sol pada 53.9% dan Claude Opus 5.5 pada 52.4%.

Kriteria Penilaian Dipimpin Pakar

Sample IUX Markets – In-articleAd

Sistem penilaian dibina berdasarkan rubrik terperinci yang dicipta oleh pakar kesihatan mental yang mengambil bahagian, dengan setiap senario disemak oleh sekurang-kurangnya tiga orang profesional. Kriteria diberikan pemberat dari -10 hingga +10 berdasarkan kepentingan klinikal untuk memberi skor kepada respons model.

Dalam analisis berasingan yang melibatkan 44 orang dewasa yang telah menggunakan AI untuk sokongan kesihatan mental, OpenAI mendapati bahawa pengguna menghargai langkah seterusnya yang praktikal dan nada yang sesuai. Sebaliknya, pakar klinikal memberi penekanan yang lebih tinggi pada keupayaan AI untuk mengumpulkan konteks yang relevan dan mentafsir situasi yang samar-samar dengan betul. Kriteria pemarkahan akhir untuk penanda aras adalah berdasarkan konsensus pakar.

Konteks dan Langkah Keselamatan yang Lebih Luas

Pengeluaran MentalHealthBench adalah sebahagian daripada usaha yang lebih luas oleh OpenAI untuk meningkatkan keselamatan dalam produknya. Syarikat itu menyatakan bahawa ia juga telah memperkukuh respons ChatGPT dalam perbualan sensitif, memperluas akses kepada sumber krisis dan memperkenalkan ciri baharu seperti pilihan "Kenalan Dipercayai" dan "ChatGPT untuk Remaja" khusus dengan perlindungan tambahan. Dengan menjadikan penanda aras ini terbuka kepada penyelidik, OpenAI bertujuan untuk memupuk pembangunan dan penelitian selanjutnya dalam bidang AI untuk kesihatan mental.

Back to latest news

LATEST