Story

OpenAI发布基准测试,用于评估人工智能模型在心理健康场景中的响应

ENTHMSVIIDZHZH-TWJAKOHI
Sep 23, 20261 min read
OpenAI发布基准测试,用于评估人工智能模型在心理健康场景中的响应

Summary

OpenAI推出了MentalHealthBench,这是一个与授权专家共同开发的开源框架,用于评估人工智能在心理健康对话中生成的回复的质量和安全性。该公司还公布了几个大型语言模型根据新标准给出的初步评分。

Text size
Background

OpenAI 于周三发布了 MentalHealthBench,这是一个全新的开源基准测试,旨在评估人工智能模型在真实心理健康对话中的表现。该框架由 OpenAI 与来自 22 个国家的 80 多位持证心理健康专家合作开发,旨在规范人工智能在这一敏感领域的评估能力。

基准测试结构和性能

MentalHealthBench 从安全、寻求上下文、维护用户自主权和提供可操作指导等关键行为方面评估人工智能模型。据 OpenAI 称,该基准测试包含多种场景:

  • 53.5% 涉及非紧急情况的日常对话。
  • 28.3% 模拟存在紧急安全隐患的紧急情况。
  • 18.2% 涵盖表明存在严重心理健康问题的高危对话。

OpenAI 使用该基准测试评估了多个人工智能模型,其中其自主研发的 GPT-5.6 Sol 模型作为自动评分器,根据专家定义的标准进行评分。该公司报告称,GPT-6 Astra 以 57.3% 的得分位居榜首,其次是 GPT-6 Sol(53.9%)和 Claude Opus 5.5(52.4%)。

专家主导的评估标准

Sample IUX Markets – In-articleAd

该评估系统基于参与的心理健康专家制定的详细评分标准构建,每个场景均由至少三位专业人士进行审核。根据临床重要性,各项标准被赋予 -10 到 +10 的权重,用于对模型响应进行评分。

在另一项针对 44 位曾使用人工智能进行心理健康支持的成年人的分析中,OpenAI 发现用户重视切实可行的后续步骤和恰当的语气。相比之下,临床专家更强调人工智能收集相关背景信息和正确解读模糊情况的能力。该基准测试的最终评分标准基于专家共识。

背景和更广泛的安全措施

MentalHealthBench 的发布是 OpenAI 为提升其产品安全性而采取的更广泛举措的一部分。该公司表示,他们还加强了 ChatGPT 在敏感对话中的响应能力,扩大了危机资源的获取途径,并推出了“可信联系人”选项和具有额外保护措施的“青少年版 ChatGPT”等新功能。通过向研究人员开放基准测试,OpenAI 旨在促进人工智能在心理健康领域的进一步发展和研究。

Back to latest news

LATEST