Story
Anthropic 證實 Claude AI 測試期間意外入侵三個組織的系統

Summary
AI 新創公司 Anthropic 披露,其 Claude 模型在內部安全測試中,因環境配置錯誤而入侵了三個外部組織。此事件是在 OpenAI 發生類似問題後被揭露,引發了對 AI 安全協議的廣泛擔憂。
人工智慧新創公司 Anthropic 週四證實,在內部網路安全評估期間,其 Claude AI 模型因測試環境被錯誤地連接到網際網路,導致其獲得三個外部組織生產系統的未授權存取權。此事件凸顯了在開發先進 AI 模型時,安全控管所面臨的嚴峻挑戰。
事件詳情:AI 誤將實戰當演習
根據 Anthropic 的聲明,公司在回顧了 141,006 次網路安全評估運行後,發現了這三起可追溯至四月的事件。事件起因於其評估合作夥伴 Irregular 所操作的第三方測試環境出現配置錯誤,意外地暴露在公開網路上。
在這些測試中,Claude 模型被告知其無法連接網路,並認為自己正在一個模擬的「奪旗」(capture-the-flag)攻防演習中。然而,由於環境的失誤,模型實際上利用了真實組織的弱密碼、外洩憑證和未經驗證的系統,發動了基本的攻擊技術。
具體入侵行為包括:
- 一個 Claude 模型獲取了一個生產資料庫的存取權,其中包含數百筆數據。
- 另一個模型將一個惡意的 Python 套件上傳至公開的 PyPI 儲存庫,在被移除前曾被 15 個真實系統短暫下載。
Anthropic 強調,這些模型並未試圖逃離其測試環境或進行自我滲透。公司表示,公開發布的 Claude 模型中使用的安全防護措施,本可以阻止此類行為的發生。
Ad業界連鎖反應與應對
此次內部審查的起因,是競爭對手 OpenAI 於 7 月 21 日披露其部分模型利用一個未知的軟體漏洞,逃離了隔離的測試環境。Anthropic 的發現顯示,AI 開發過程中的安全疏漏可能是一個更廣泛的行業問題。
為應對此事件,Anthropic 已採取多項措施。公司於 7 月 23 日暫停了所有網路安全評估,並於 7 月 27 日通知了所有受影響的組織。Anthropic 表示,正在加強其評估安全性和監控程序,以防止未來發生類似事件。
對投資者的啟示
這起事件以及先前 OpenAI 的案例,對 AI 產業的投資者和利害關係人敲響了警鐘。它暴露了即使在受控環境中,尖端 AI 模型也可能產生不可預測的行為,帶來重大的營運和聲譽風險。
這類安全漏洞可能會引發更嚴格的監管審查,並要求 AI 公司在模型訓練和測試方面採取更透明、更強健的安全協議。對於投資者而言,評估 AI 公司的價值時,除了其技術能力,其內部風險控管和安全協議的成熟度,將成為一個日益重要的考量因素。