Story

ओपनएआई ने मानसिक स्वास्थ्य परिदृश्यों में एआई मॉडल की प्रतिक्रियाओं का मूल्यांकन करने के लिए एक बेंचमार्क जारी किया है।

ENTHMSVIIDZHZH-TWJAKOHI
Sep 23, 20262 min read
ओपनएआई ने मानसिक स्वास्थ्य परिदृश्यों में एआई मॉडल की प्रतिक्रियाओं का मूल्यांकन करने के लिए एक बेंचमार्क जारी किया है।

Summary

ओपनएआई ने मेंटल हेल्थ बेंच लॉन्च किया है, जो लाइसेंस प्राप्त विशेषज्ञों के साथ मिलकर विकसित किया गया एक ओपन-सोर्स फ्रेमवर्क है। इसका उद्देश्य मानसिक स्वास्थ्य संबंधी बातचीत में एआई द्वारा उत्पन्न प्रतिक्रियाओं की गुणवत्ता और सुरक्षा का आकलन करना है। कंपनी ने नए मानक के आधार पर कई बड़े भाषा मॉडलों के प्रारंभिक स्कोर भी प्रकाशित किए हैं।

Text size
Background

बुधवार को OpenAI ने MentalHealthBench नामक एक नया ओपन-सोर्स बेंचमार्क जारी किया, जिसे वास्तविक मानसिक स्वास्थ्य संबंधी बातचीत में AI मॉडल के प्रदर्शन का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इस फ्रेमवर्क को 22 देशों के 80 से अधिक लाइसेंस प्राप्त मानसिक स्वास्थ्य विशेषज्ञों के सहयोग से विकसित किया गया है ताकि इस संवेदनशील क्षेत्र में AI क्षमताओं के आकलन को मानकीकृत किया जा सके।

बेंचमार्क संरचना और प्रदर्शन

MentalHealthBench AI मॉडल का मूल्यांकन सुरक्षा, संदर्भ की खोज, उपयोगकर्ता की स्वायत्तता को बनाए रखना और कार्रवाई योग्य मार्गदर्शन प्रदान करने जैसे प्रमुख व्यवहारों के आधार पर करता है। OpenAI के अनुसार, बेंचमार्क में विभिन्न परिदृश्य शामिल हैं:

  • 53.5% में सामान्य, रोजमर्रा की बातचीत शामिल है।
  • 28.3% में तत्काल सुरक्षा संबंधी चिंताओं वाली आपात स्थितियों का अनुकरण किया गया है।
  • 18.2% में गंभीर मानसिक स्वास्थ्य समस्याओं का संकेत देने वाली उच्च-तीव्रता वाली बातचीत शामिल है।

OpenAI ने बेंचमार्क के आधार पर कई AI मॉडल का मूल्यांकन किया, जिसमें उसका अपना GPT-5.6 Sol मॉडल विशेषज्ञ-परिभाषित मानदंडों के आधार पर स्वचालित ग्रेडर के रूप में कार्य करता है। कंपनी ने बताया कि GPT-6 Astra ने 57.3% के साथ सर्वोच्च स्कोर प्राप्त किया, इसके बाद GPT-6 Sol 53.9% और Claude Opus 5.5 52.4% के साथ दूसरे और तीसरे स्थान पर रहे।

विशेषज्ञ-आधारित मूल्यांकन मानदंड

Sample IUX Markets – In-articleAd

मूल्यांकन प्रणाली भाग लेने वाले मानसिक स्वास्थ्य विशेषज्ञों द्वारा तैयार किए गए विस्तृत मानदंडों पर आधारित थी, जिसमें प्रत्येक परिदृश्य की समीक्षा कम से कम तीन पेशेवरों द्वारा की गई थी। मॉडल प्रतिक्रियाओं को स्कोर करने के लिए नैदानिक महत्व के आधार पर मानदंडों को -10 से +10 तक भारित किया गया था।

मानसिक स्वास्थ्य सहायता के लिए AI का उपयोग करने वाले 44 वयस्कों पर किए गए एक अलग विश्लेषण में, OpenAI ने पाया कि उपयोगकर्ता व्यावहारिक अगले चरणों और उपयुक्त लहजे को महत्व देते हैं। इसके विपरीत, नैदानिक विशेषज्ञों ने प्रासंगिक संदर्भ एकत्र करने और अस्पष्ट स्थितियों की सही व्याख्या करने की AI की क्षमता पर अधिक जोर दिया। बेंचमार्क के लिए अंतिम स्कोरिंग मानदंड विशेषज्ञ सहमति पर आधारित थे।

संदर्भ और व्यापक सुरक्षा उपाय

MentalHealthBench का लॉन्च OpenAI द्वारा अपने उत्पादों में सुरक्षा बढ़ाने के व्यापक प्रयास का एक हिस्सा है। कंपनी ने बताया कि उसने संवेदनशील बातचीत में ChatGPT की प्रतिक्रियाओं को और मजबूत किया है, संकटकालीन संसाधनों तक पहुंच का विस्तार किया है और "विश्वसनीय संपर्क" विकल्प और अतिरिक्त सुरक्षा सुविधाओं के साथ "किशोरों के लिए विशेष ChatGPT" जैसी नई सुविधाएं पेश की हैं। बेंचमार्क को शोधकर्ताओं के लिए सुलभ बनाकर, OpenAI का उद्देश्य मानसिक स्वास्थ्य के क्षेत्र में AI के विकास और गहन शोध को बढ़ावा देना है।

Back to latest news

LATEST