Story
OpenAI, 정신 건강 시나리오에서 AI 모델 반응 평가 벤치마크 공개

Summary
OpenAI는 정신 건강 관련 대화에서 AI가 생성한 답변의 품질과 안전성을 평가하기 위해 라이선스를 보유한 전문가들과 함께 개발한 오픈 소스 프레임워크인 MentalHealthBench를 출시했습니다. 또한, 이 회사는 새로운 표준에 대한 여러 대형 언어 모델의 초기 평가 점수도 공개했습니다.
OpenAI는 수요일, 현실적인 정신 건강 대화 상황에서 AI 모델의 성능을 평가하기 위해 설계된 새로운 오픈 소스 벤치마크인 MentalHealthBench를 공개했습니다. 이 프레임워크는 22개국 80명 이상의 정신 건강 전문가와의 협력을 통해 개발되었으며, 민감한 분야인 정신 건강 분야에서 AI 역량 평가를 표준화하는 것을 목표로 합니다.
벤치마크 구조 및 성능
MentalHealthBench는 안전성 확보, 맥락 파악, 사용자 자율성 유지, 실질적인 지침 제공 등 핵심적인 행동 측면에서 AI 모델을 평가합니다. OpenAI에 따르면, 이 벤치마크는 다음과 같은 다양한 시나리오로 구성됩니다.
- 53.5%는 심각하지 않은 일상적인 대화입니다.
28.3%는 즉각적인 안전 문제가 있는 응급 상황을 시뮬레이션합니다.
18.2%는 심각한 정신 건강 문제를 나타내는 고난도 대화입니다.
OpenAI는 자체 개발한 GPT-5.6 Sol 모델을 전문가가 정의한 기준에 따라 자동 평가 도구로 활용하여 여러 AI 모델을 이 벤치마크에 대해 평가했습니다. 회사 측은 GPT-6 Astra가 57.3%로 가장 높은 점수를 기록했으며, GPT-6 Sol이 53.9%, Claude Opus 5.5가 52.4%로 그 뒤를 이었다고 발표했습니다.
Ad전문가 주도 평가 기준
평가 시스템은 참여한 정신 건강 전문가들이 작성한 상세한 평가 기준표를 기반으로 구축되었으며, 각 시나리오는 최소 세 명의 전문가가 검토했습니다. 모델 응답 점수는 임상적 중요도를 기준으로 -10에서 +10까지 가중치를 부여하여 산출했습니다.
AI를 활용하여 정신 건강 지원을 받은 성인 44명을 대상으로 한 별도 분석에서 OpenAI는 사용자들이 실질적인 다음 단계 제시와 적절한 어조를 중요하게 생각한다는 것을 발견했습니다. 반면, 임상 전문가들은 AI가 관련 맥락을 수집하고 모호한 상황을 정확하게 해석하는 능력을 더 중요하게 여겼습니다. 벤치마크의 최종 점수 기준은 전문가들의 합의를 바탕으로 결정되었습니다.
배경 및 강화된 안전 조치
MentalHealthBench 공개는 OpenAI가 자사 제품의 안전성을 강화하기 위한 광범위한 노력의 일환입니다. OpenAI는 민감한 대화에 대한 ChatGPT의 대응을 강화하고, 위기 지원 자원에 대한 접근성을 확대했으며, "신뢰할 수 있는 연락처" 옵션과 추가 보호 기능을 갖춘 "청소년 전용 ChatGPT"와 같은 새로운 기능을 도입했다고 밝혔습니다. OpenAI는 연구자들이 벤치마크를 활용할 수 있도록 공개함으로써 정신 건강 분야 AI의 발전과 검증을 촉진하고자 합니다.