Story

OpenAI công bố bộ dữ liệu chuẩn để đánh giá phản hồi của mô hình AI trong các tình huống sức khỏe tâm thần.

ENTHMSVIIDZHZH-TWJAKOHI
Sep 23, 20263 min read
OpenAI công bố bộ dữ liệu chuẩn để đánh giá phản hồi của mô hình AI trong các tình huống sức khỏe tâm thần.

Summary

OpenAI đã ra mắt MentalHealthBench, một khung phần mềm mã nguồn mở được phát triển với sự hợp tác của các chuyên gia có giấy phép để đánh giá chất lượng và độ an toàn của các phản hồi do AI tạo ra trong các cuộc hội thoại về sức khỏe tâm thần. Công ty cũng đã công bố điểm số ban đầu cho một số mô hình ngôn ngữ lớn dựa trên tiêu chuẩn mới này.

Text size
Background

Hôm thứ Tư, OpenAI đã phát hành MentalHealthBench, một bộ tiêu chuẩn mã nguồn mở mới được thiết kế để đánh giá hiệu suất của các mô hình AI trong các cuộc hội thoại sức khỏe tâm thần thực tế. Khung tiêu chuẩn này được phát triển với sự hợp tác của hơn 80 chuyên gia sức khỏe tâm thần được cấp phép từ 22 quốc gia nhằm chuẩn hóa việc đánh giá khả năng của AI trong lĩnh vực nhạy cảm này.

Cấu trúc và Hiệu suất của Tiêu chuẩn

MentalHealthBench đánh giá các mô hình AI dựa trên các hành vi chính như an toàn, tìm kiếm ngữ cảnh, bảo vệ quyền tự chủ của người dùng và cung cấp hướng dẫn có thể hành động. Theo OpenAI, tiêu chuẩn này bao gồm nhiều kịch bản khác nhau:

  • 53,5% liên quan đến các cuộc hội thoại hàng ngày, không cấp tính.
  • 28,3% mô phỏng các trường hợp khẩn cấp với các mối lo ngại về an toàn ngay lập tức.
  • 18,2% bao gồm các cuộc hội thoại cấp cao cho thấy các vấn đề sức khỏe tâm thần nghiêm trọng.

OpenAI đã đánh giá một số mô hình AI dựa trên tiêu chuẩn này, với mô hình GPT-5.6 Sol của riêng mình đóng vai trò là người chấm điểm tự động dựa trên các tiêu chí do chuyên gia định nghĩa. Công ty báo cáo rằng GPT-6 Astra đạt điểm cao nhất với 57,3%, tiếp theo là GPT-6 Sol với 53,9% và Claude Opus 5.5 với 52,4%.

Tiêu chí đánh giá do chuyên gia dẫn dắt

Sample IUX Markets – In-articleAd

Hệ thống đánh giá được xây dựng dựa trên các tiêu chí chi tiết do các chuyên gia sức khỏe tâm thần tham gia tạo ra, với mỗi kịch bản được ít nhất ba chuyên gia xem xét. Các tiêu chí được gán trọng số từ -10 đến +10 dựa trên tầm quan trọng lâm sàng để chấm điểm phản hồi của mô hình.

Trong một phân tích riêng biệt liên quan đến 44 người trưởng thành đã sử dụng AI để hỗ trợ sức khỏe tâm thần, OpenAI nhận thấy rằng người dùng đánh giá cao các bước tiếp theo thực tế và giọng điệu phù hợp. Ngược lại, các chuyên gia lâm sàng nhấn mạnh hơn vào khả năng của AI trong việc thu thập bối cảnh liên quan và diễn giải chính xác các tình huống mơ hồ. Các tiêu chí chấm điểm cuối cùng cho chuẩn mực dựa trên sự đồng thuận của chuyên gia.

Bối cảnh và các biện pháp an toàn rộng hơn

Việc phát hành MentalHealthBench là một phần trong nỗ lực rộng lớn hơn của OpenAI nhằm tăng cường an toàn cho các sản phẩm của mình. Công ty này cho biết họ cũng đã tăng cường khả năng phản hồi của ChatGPT trong các cuộc hội thoại nhạy cảm, mở rộng quyền truy cập vào các nguồn lực hỗ trợ khủng hoảng và giới thiệu các tính năng mới như tùy chọn "Liên hệ đáng tin cậy" và "ChatGPT dành cho thanh thiếu niên" chuyên dụng với các biện pháp bảo vệ bổ sung. Bằng cách công khai tiêu chuẩn này cho các nhà nghiên cứu, OpenAI hướng đến việc thúc đẩy sự phát triển và kiểm chứng sâu rộng hơn trong lĩnh vực trí tuệ nhân tạo dành cho sức khỏe tâm thần.

Back to latest news

LATEST