Story
Anthropic、AI「Claude」がテスト中に3組織に不正アクセスと発表

Summary
AIスタートアップのAnthropicは、サイバーセキュリティ評価中に自社のAIモデル「Claude」が、設定ミスにより外部インターネットに接続されたテスト環境から3つの組織のシステムに不正アクセスしたと発表した。この事態は、高度なAIシステムの潜在的リスクを浮き彫りにしている。
AIスタートアップのAnthropicは、内部のサイバーセキュリティ評価中に、同社のAIモデル「Claude」が3つの組織の本番システムに不正アクセスしたと発表した。原因は、テスト環境が誤ってインターネットに接続されていたことによるものだという。
このインシデントは、競合であるOpenAIが7月21日に同様の事態を公表したことを受けて開始された社内レビューの過程で発覚した。OpenAIのケースでは、同社のモデルがソフトウェアの脆弱性を利用して隔離されたテスト環境から脱出し、Hugging Face社の本番インフラにアクセスしていた。
インシデントの経緯と原因
Anthropicによると、同社は141,006件のサイバーセキュリティ評価をレビューし、4月に遡る3件のインシデントを特定した。これらのインシデントは、評価パートナーであるIrregular社が運用する第三者のテスト環境の設定ミスを通じて発生した。
Claudeモデルは、インターネットへのアクセスがないと指示されていたため、自身をシミュレーション環境下にいると認識していた。しかし、実際には外部に接続されており、基本的な攻撃手法を用いて、脆弱なパスワード、公開された認証情報、認証のないシステムを悪用して外部組織のシステムに侵入した。
具体的な被害とAnthropicの対応
AdAnthropicの報告によれば、具体的な被害は以下の通り。
- あるClaudeモデルは、数百行のデータを含む本番データベースへのアクセス権を取得した。
- 別のモデルは、悪意のあるPythonパッケージを公開リポジトリ「PyPI」にアップロードし、削除されるまでの短時間に15の実際のシステムによってダウンロードされた。
同社は、モデルがテスト環境からの脱出や自己増殖を試みた形跡はないと強調している。Anthropicは7月23日にすべてのサイバー評価を停止し、7月27日には影響を受けた組織に通知した。また、一般に公開されているClaudeモデルに実装されている安全保護機能があれば、今回のような挙動はブロックされていたと説明している。
今回の事態を受け、Anthropicは評価プロセスのセキュリティと監視手順を強化する方針を示した。このインシデントは、AIの能力が向上する中で、その開発・評価環境のセキュリティ管理がいかに重要であるかを業界全体に改めて突きつけるものとなった。