Story
ओपनएआई ने मानसिक स्वास्थ्य परिदृश्यों में एआई मॉडल की प्रतिक्रियाओं का मूल्यांकन करने के लिए एक बेंचमार्क जारी किया है।

Summary
ओपनएआई ने मेंटल हेल्थ बेंच लॉन्च किया है, जो लाइसेंस प्राप्त विशेषज्ञों के साथ मिलकर विकसित किया गया एक ओपन-सोर्स फ्रेमवर्क है। इसका उद्देश्य मानसिक स्वास्थ्य संबंधी बातचीत में एआई द्वारा उत्पन्न प्रतिक्रियाओं की गुणवत्ता और सुरक्षा का आकलन करना है। कंपनी ने नए मानक के आधार पर कई बड़े भाषा मॉडलों के प्रारंभिक स्कोर भी प्रकाशित किए हैं।
बुधवार को OpenAI ने MentalHealthBench नामक एक नया ओपन-सोर्स बेंचमार्क जारी किया, जिसे वास्तविक मानसिक स्वास्थ्य संबंधी बातचीत में AI मॉडल के प्रदर्शन का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इस फ्रेमवर्क को 22 देशों के 80 से अधिक लाइसेंस प्राप्त मानसिक स्वास्थ्य विशेषज्ञों के सहयोग से विकसित किया गया है ताकि इस संवेदनशील क्षेत्र में AI क्षमताओं के आकलन को मानकीकृत किया जा सके।
बेंचमार्क संरचना और प्रदर्शन
MentalHealthBench AI मॉडल का मूल्यांकन सुरक्षा, संदर्भ की खोज, उपयोगकर्ता की स्वायत्तता को बनाए रखना और कार्रवाई योग्य मार्गदर्शन प्रदान करने जैसे प्रमुख व्यवहारों के आधार पर करता है। OpenAI के अनुसार, बेंचमार्क में विभिन्न परिदृश्य शामिल हैं:
- 53.5% में सामान्य, रोजमर्रा की बातचीत शामिल है।
- 28.3% में तत्काल सुरक्षा संबंधी चिंताओं वाली आपात स्थितियों का अनुकरण किया गया है।
- 18.2% में गंभीर मानसिक स्वास्थ्य समस्याओं का संकेत देने वाली उच्च-तीव्रता वाली बातचीत शामिल है।
OpenAI ने बेंचमार्क के आधार पर कई AI मॉडल का मूल्यांकन किया, जिसमें उसका अपना GPT-5.6 Sol मॉडल विशेषज्ञ-परिभाषित मानदंडों के आधार पर स्वचालित ग्रेडर के रूप में कार्य करता है। कंपनी ने बताया कि GPT-6 Astra ने 57.3% के साथ सर्वोच्च स्कोर प्राप्त किया, इसके बाद GPT-6 Sol 53.9% और Claude Opus 5.5 52.4% के साथ दूसरे और तीसरे स्थान पर रहे।
विशेषज्ञ-आधारित मूल्यांकन मानदंड
Adमूल्यांकन प्रणाली भाग लेने वाले मानसिक स्वास्थ्य विशेषज्ञों द्वारा तैयार किए गए विस्तृत मानदंडों पर आधारित थी, जिसमें प्रत्येक परिदृश्य की समीक्षा कम से कम तीन पेशेवरों द्वारा की गई थी। मॉडल प्रतिक्रियाओं को स्कोर करने के लिए नैदानिक महत्व के आधार पर मानदंडों को -10 से +10 तक भारित किया गया था।
मानसिक स्वास्थ्य सहायता के लिए AI का उपयोग करने वाले 44 वयस्कों पर किए गए एक अलग विश्लेषण में, OpenAI ने पाया कि उपयोगकर्ता व्यावहारिक अगले चरणों और उपयुक्त लहजे को महत्व देते हैं। इसके विपरीत, नैदानिक विशेषज्ञों ने प्रासंगिक संदर्भ एकत्र करने और अस्पष्ट स्थितियों की सही व्याख्या करने की AI की क्षमता पर अधिक जोर दिया। बेंचमार्क के लिए अंतिम स्कोरिंग मानदंड विशेषज्ञ सहमति पर आधारित थे।
संदर्भ और व्यापक सुरक्षा उपाय
MentalHealthBench का लॉन्च OpenAI द्वारा अपने उत्पादों में सुरक्षा बढ़ाने के व्यापक प्रयास का एक हिस्सा है। कंपनी ने बताया कि उसने संवेदनशील बातचीत में ChatGPT की प्रतिक्रियाओं को और मजबूत किया है, संकटकालीन संसाधनों तक पहुंच का विस्तार किया है और "विश्वसनीय संपर्क" विकल्प और अतिरिक्त सुरक्षा सुविधाओं के साथ "किशोरों के लिए विशेष ChatGPT" जैसी नई सुविधाएं पेश की हैं। बेंचमार्क को शोधकर्ताओं के लिए सुलभ बनाकर, OpenAI का उद्देश्य मानसिक स्वास्थ्य के क्षेत्र में AI के विकास और गहन शोध को बढ़ावा देना है।