Story
OpenAI เผยเกณฑ์มาตรฐานเพื่อประเมินการตอบสนองของโมเดล AI ในสถานการณ์ด้านสุขภาพจิต

Summary
OpenAI ได้เปิดตัว MentalHealthBench ซึ่งเป็นเฟรมเวิร์กโอเพนซอร์สที่พัฒนาขึ้นโดยความร่วมมือกับผู้เชี่ยวชาญที่ได้รับอนุญาต เพื่อประเมินคุณภาพและความปลอดภัยของคำตอบที่สร้างโดย AI ในการสนทนาเกี่ยวกับสุขภาพจิต บริษัทฯ ยังได้เผยแพร่คะแนนเบื้องต้นสำหรับโมเดลภาษาขนาดใหญ่หลายแบบเทียบกับมาตรฐานใหม่นี้ด้วย
เมื่อวันพุธที่ผ่านมา OpenAI ได้เปิดตัว MentalHealthBench ซึ่งเป็นเกณฑ์มาตรฐานโอเพนซอร์สใหม่ที่ออกแบบมาเพื่อประเมินประสิทธิภาพของโมเดล AI ในการสนทนาเกี่ยวกับสุขภาพจิตที่สมจริง กรอบการทำงานนี้ได้รับการพัฒนาร่วมกับผู้เชี่ยวชาญด้านสุขภาพจิตที่ได้รับใบอนุญาตมากกว่า 80 คนจาก 22 ประเทศ เพื่อสร้างมาตรฐานการประเมินความสามารถของ AI ในด้านที่ละเอียดอ่อนนี้
โครงสร้างและประสิทธิภาพของเกณฑ์มาตรฐาน
MentalHealthBench ประเมินโมเดล AI ในพฤติกรรมหลักๆ เช่น ความปลอดภัย การแสวงหาบริบท การรักษาอำนาจการตัดสินใจของผู้ใช้ และการให้คำแนะนำที่นำไปปฏิบัติได้ ตามข้อมูลของ OpenAI เกณฑ์มาตรฐานนี้ประกอบด้วยสถานการณ์ต่างๆ ดังนี้:
- 53.5% เกี่ยวข้องกับการสนทนาทั่วไปในชีวิตประจำวัน
- 28.3% จำลองสถานการณ์ฉุกเฉินที่มีข้อกังวลด้านความปลอดภัยในทันที
- 18.2% ครอบคลุมการสนทนาที่มีความรุนแรงสูงซึ่งบ่งชี้ถึงปัญหาสุขภาพจิตที่ร้ายแรง
OpenAI ได้ประเมินโมเดล AI หลายตัวเทียบกับเกณฑ์มาตรฐาน โดยใช้โมเดล GPT-5.6 Sol ของตนเองเป็นตัวประเมินอัตโนมัติตามเกณฑ์ที่ผู้เชี่ยวชาญกำหนด บริษัทรายงานว่า GPT-6 Astra ได้คะแนนสูงสุดที่ 57.3% ตามมาด้วย GPT-6 Sol ที่ 53.9% และ Claude Opus 5.5 ที่ 52.4%
เกณฑ์การประเมินโดยผู้เชี่ยวชาญ
Adระบบการประเมินสร้างขึ้นจากเกณฑ์โดยละเอียดที่สร้างโดยผู้เชี่ยวชาญด้านสุขภาพจิตที่เข้าร่วม โดยแต่ละสถานการณ์ได้รับการตรวจสอบโดยผู้เชี่ยวชาญอย่างน้อยสามคน เกณฑ์ต่างๆ ได้รับการกำหนดค่าน้ำหนักตั้งแต่ -10 ถึง +10 โดยพิจารณาจากความสำคัญทางคลินิกเพื่อให้คะแนนการตอบสนองของแบบจำลอง
ในการวิเคราะห์แยกต่างหากที่เกี่ยวข้องกับผู้ใหญ่ 44 คนที่ใช้ AI เพื่อการสนับสนุนด้านสุขภาพจิต OpenAI พบว่าผู้ใช้ให้คุณค่ากับขั้นตอนต่อไปที่เป็นรูปธรรมและน้ำเสียงที่เหมาะสม ในทางตรงกันข้าม ผู้เชี่ยวชาญทางคลินิกให้ความสำคัญกับความสามารถของ AI ในการรวบรวมบริบทที่เกี่ยวข้องและตีความสถานการณ์ที่คลุมเครือได้อย่างถูกต้องมากกว่า เกณฑ์การให้คะแนนสุดท้ายสำหรับเกณฑ์มาตรฐานนั้นอิงตามฉันทามติของผู้เชี่ยวชาญ
บริบทและมาตรการความปลอดภัยที่ครอบคลุมมากขึ้น
การเปิดตัว MentalHealthBench เป็นส่วนหนึ่งของความพยายามที่กว้างขึ้นของ OpenAI ในการเพิ่มความปลอดภัยในผลิตภัณฑ์ของบริษัท บริษัทระบุว่าได้เสริมความแข็งแกร่งในการตอบสนองของ ChatGPT ในการสนทนาที่ละเอียดอ่อน ขยายการเข้าถึงแหล่งข้อมูลวิกฤต และแนะนำคุณสมบัติใหม่ ๆ เช่น ตัวเลือก "ผู้ติดต่อที่เชื่อถือได้" และ "ChatGPT สำหรับวัยรุ่น" ที่มีระบบป้องกันเพิ่มเติม ด้วยการเปิดให้ผู้วิจัยเข้าถึงเกณฑ์มาตรฐานนี้ OpenAI มุ่งหวังที่จะส่งเสริมการพัฒนาและการตรวจสอบเพิ่มเติมในด้าน AI สำหรับสุขภาพจิต
Read next
More on หุ้น
มีรายงานว่า MGM Resorts กำลังพิจารณาเสนอราคาซื้อกิจการ People Inc. ซึ่งเป็นผู้ถือหุ้นรายใหญ่ที่สุด
รายงานจากวอลล์สตรีทเจอร์นัลระบุว่า บริษัท MGM Resorts International ผู้ประกอบการคาสิโน กำลังพิจารณาความเป็นไปได้ในการยื่นข้อเสนอซื้อกิจการ People Inc. ซึ่งเป็นการเคลื่อนไหวที่น่าประหลาดใจ เนื่องจากเกิดขึ้นเพียงหนึ่งวันหลังจากที่ People Inc. ถอนข้อเสนอซื้อกิจการ MGM ของตนเองไปแล้ว

กองทุน Ares Private Credit Fund พบว่าคำขอไถ่ถอนลดลงในไตรมาสที่สาม
เอกสารที่ยื่นต่อหน่วยงานกำกับดูแลแสดงให้เห็นว่า คำขอถอนเงินจากกองทุนสินเชื่อส่วนบุคคลหลักมูลค่า 22.7 พันล้านดอลลาร์ของ Ares Management ลดลงในไตรมาสที่สาม ซึ่งสะท้อนให้เห็นถึงแนวโน้มที่กว้างขึ้นของการไถ่ถอนที่ลดลงทั่วทั้งภาคส่วนนี้

รายงานระบุว่า Anthropic เสนอหุ้นสองประเภทเพื่อรักษาอำนาจการควบคุมของกลุ่มผู้ก่อตั้งก่อนการเสนอขายหุ้น IPO
รายงานล่าสุดระบุว่า บริษัทปัญญาประดิษฐ์ Anthropic กำลังขออนุมัติจากผู้ถือหุ้นสำหรับโครงสร้างหุ้นสองประเภทที่จะมอบอำนาจการออกเสียงส่วนใหญ่ให้กับผู้ร่วมก่อตั้งทั้งเจ็ดคน การเคลื่อนไหวครั้งนี้เกิดขึ้นในขณะที่บริษัทกำลังเตรียมตัวสำหรับการเข้าจดทะเบียนในตลาดหลักทรัพย์ที่หลายคนตั้งตารอคอย

สมาคมสายการบินแห่งอเมริกาเตือนว่า การห้ามส่งออกดีเซลของสหรัฐฯ อาจทำให้ราคาน้ำมันเชื้อเพลิงสูงขึ้น
กลุ่มการค้าสายการบินรายใหญ่ของสหรัฐฯ ได้แสดงจุดยืนคัดค้านการห้ามส่งออกน้ำมันดีเซล โดยให้เหตุผลว่านโยบายดังกล่าวอาจส่งผลให้ราคาน้ำมันเชื้อเพลิงสูงขึ้นและส่งผลกระทบอย่างรุนแรงต่อสายการบินต่างๆ