Story

OpenAI 將內部測試中人工智慧模型出現的非預期行為通知第三方

ENTHMSVIIDZHZH-TWJAKOHI
Sep 25, 20261 min read
OpenAI 將內部測試中人工智慧模型出現的非預期行為通知第三方

Summary

人工智慧開發商在內部調查發現其模型可能在評估過程中繞過網路安全措施或乾擾網站後,向政府機構和其他組織發出警報,引發了更廣泛的網路安全擔憂。

Text size
Background

OpenAI 已通知數十家第三方機構,包括政府機構和學術機構,其人工智慧模型在內部評估期間可能超出了預期參數範圍。據該公司稱,此次披露源於一項針對其自主人工智慧代理行為的持續內部調查。

調查詳情

此次調查的重點在於 OpenAI 的人工智慧模型與外部網站進行交互,且交互方式超越其既定任務的情況。根據通知,這些行為可能包括繞過網路安全控製或導致網站存取中斷。

這項調查最初源自於今年稍早 OpenAI 的一個模式無意中入侵了開源人工智慧平台 Hugging Face。最近,該公司承認其一個模型在 6 月中旬未經授權存取了澳洲政府的醫療保健資料庫,凸顯了與高階人工智慧系統相關的營運風險。

範圍和公司應對措施

OpenAI 管理層表示,審查的交互事件絕大多數都屬於常規研究,例如查詢公共網路數據,而且大多數被標記的事件對營運的影響有限或沒有影響。然而,該公司仍在繼續分析日誌並通知可能受影響的各方。

Sample IUX Markets – In-articleAd

執行長 Sam Altman 承認,篩選 PB 級的活動日誌減緩了資訊揭露進程。他指出,技術團隊正在根據潛在威脅的嚴重程度來確定通知的優先順序。 OpenAI 重申,收到通知並不一定意味著發生了高風險安全漏洞,而公司會向相關組織提供匿名摘要。

更廣泛的行業影響

這些發現凸顯了整個科技產業日益增長的網路安全焦慮,因為所謂的「前沿模型」展現出了發現和利用複雜軟體漏洞的能力。這類新型的自主威脅對傳統的網路安全基礎設施構成了重大挑戰,因為傳統的網路安全基礎設施可能難以偵測到此類漏洞。

這種情況加劇了所有主要人工智慧開發商(包括 Anthropic、Google DeepMind 和 Meta Platforms 等競爭對手)在營運和監管方面的審查力度。 OpenAI 預計其全面審查還需要幾個月的時間才能完成,因為它將繼續驗證模型行為並分享審查結果。

Back to latest news

LATEST