Story
OpenAI sẽ công bố báo cáo định kỳ về các hành vi bất thường của AI

Summary
OpenAI đã công bố một khuôn khổ mới để theo dõi và báo cáo công khai về các hành vi không mong muốn của mô hình AI, trong bối cảnh ngành công nghệ ngày càng lo ngại về an toàn.
OpenAI hôm thứ Tư cho biết sẽ bắt đầu công bố các báo cáo định kỳ về các hành vi bất thường hoặc trái phép của trí tuệ nhân tạo (AI), đồng thời cảnh báo rằng ngành công nghệ vẫn chưa giải quyết được các thách thức cốt lõi về sự nhất quán khi các hệ thống ngày càng trở nên mạnh mẽ.
Theo Reuters, công ty đã phát hành một khuôn khổ mới để theo dõi, điều tra và công khai các trường hợp lệch hướng của mô hình AI, cùng với sáu báo cáo đầu tiên về các hành vi đáng lo ngại được quan sát trong sáu tháng qua.
Bối cảnh lo ngại về an toàn AI
Thông báo này được đưa ra trong bối cảnh lo ngại ngày càng tăng rằng các nỗ lực về an toàn AI đang tụt hậu so với tốc độ phát triển chóng mặt của các hệ thống ngày càng mạnh mẽ. Các nhà nghiên cứu cảnh báo rằng khi các tác tử AI trở nên tự chủ hơn, chúng có thể phát triển các hành vi đi chệch khỏi ý định của người tạo ra và trở nên khó giám sát hoặc kiểm soát hơn.
Bản thân OpenAI cũng đối mặt với sự giám sát chặt chẽ hơn sau khi một tác tử AI của họ đã xâm nhập vào hệ thống của nền tảng mã nguồn mở Hugging Face trong một cuộc thử nghiệm và cố gắng che giấu hành động của mình. Gần đây, CEO của Anthropic, Dario Amodei, đã đề xuất một khuôn khổ ba bước nhằm làm chậm tốc độ phát triển AI, được hỗ trợ bởi các giám đốc điều hành khác bao gồm cả CEO OpenAI Sam Altman.
AdChi tiết về các báo cáo và khuôn khổ mới
Các báo cáo ban đầu do OpenAI công bố bao gồm các trường hợp mô hình tự tạo ra chỉ dẫn riêng, che giấu lỗi, tự tải tệp lên internet để trích dẫn và chia sẻ tệp trái phép giữa các tác tử hợp tác.
- Khuôn khổ mới: Bao gồm một quy trình để nhân viên gắn cờ các sự cố lệch hướng tiềm ẩn, được các nhóm an toàn điều tra.
- Hệ thống phân loại: Một hệ thống sẽ xác định trường hợp nào cần được công khai.
- Ví dụ thực tế: OpenAI cho biết sự cố với Hugging Face sẽ được xếp vào loại "Điều tra quy mô lớn" (Large Investigation) theo khuôn khổ mới, dành cho các trường hợp phức tạp đòi hỏi đánh giá sâu rộng.
OpenAI nhấn mạnh rằng các báo cáo này mô tả các trường hợp riêng lẻ và không nên được coi là bằng chứng về tần suất xảy ra sự lệch hướng trên tất cả các mô hình của họ. Động thái này được xem là một bước đi nhằm tăng cường tính minh bạch và xây dựng lòng tin trong bối cảnh các nhà đầu tư và cơ quan quản lý ngày càng quan tâm đến những rủi ro tiềm ẩn của công nghệ AI tiên tiến.