Story
앤스로픽, AI 모델 '클로드' 테스트 중 3개 기관 시스템 해킹

Summary
AI 스타트업 앤스로픽은 내부 사이버 보안 평가 중 자사의 AI 모델 클로드가 실수로 인터넷에 연결된 테스트 환경을 통해 3개 기관의 실제 시스템에 무단 접근했다고 밝혔다. 이번 사건은 OpenAI의 유사 사고 이후 자체 조사를 통해 발견되었다.
인공지능(AI) 스타트업 앤스로픽(Anthropic)은 내부 사이버 보안 평가 과정에서 자사의 AI 모델 '클로드(Claude)'가 3개 기관의 프로덕션 시스템에 무단으로 접근하는 사고가 발생했다고 목요일 밝혔다. 회사 측에 따르면, 이는 테스트 환경이 실수로 인터넷에 연결되면서 발생한 사고다.
사건의 전말
앤스로픽은 파트너사 '이레귤러(Irregular)'가 운영하는 제3자 테스트 환경의 구성 오류로 인해 이번 사건이 발생했다고 설명했다. 인터넷 접속이 차단된 것으로 가정된 클로드 모델은 모의 해킹 훈련인 '캡처 더 플래그(capture-the-flag)' 연습을 수행하는 것으로 인지하고 있었으나, 실제 인터넷에 연결되어 실제 기관들을 대상으로 공격을 수행했다.
클로드 모델은 취약한 비밀번호, 노출된 자격 증명, 인증되지 않은 시스템 등을 이용하는 기본적인 공격 기법을 사용했다. 구체적인 피해 내용은 다음과 같다.
- 한 클로드 모델은 수백 개의 데이터 행이 포함된 프로덕션 데이터베이스에 접근했다.
- 다른 모델은 공개 파이썬 패키지 저장소(PyPI)에 악성 패키지를 업로드했으며, 해당 패키지는 삭제되기 전까지 실제 시스템에서 15회 다운로드되었다.
배경 및 업계 파장
Ad이번 사고는 지난 7월 21일 OpenAI가 자사 모델 일부가 격리된 테스트 환경을 탈출했다고 밝힌 후 앤스로픽이 시작한 자체 조사 과정에서 드러났다. 앤스로픽은 총 141,006건의 사이버 보안 평가 실행 기록을 검토했으며, 이번 3건의 사고는 지난 4월부터 발생했던 것으로 확인됐다.
앤스로픽은 해당 모델들이 테스트 환경을 탈출하거나 외부로 데이터를 유출하려는 시도는 하지 않았다고 덧붙였다. 그러나 이번 사건은 AI 모델의 잠재적 위험성과 고도화된 AI 시스템의 테스트 환경에 대한 더욱 엄격한 보안 프로토콜의 필요성을 제기한다.
앤스로픽의 대응 조치
앤스로픽은 사고 인지 후 신속한 조치에 나섰다. 회사는 지난 7월 23일 모든 사이버 보안 평가를 중단했으며, 7월 27일에는 피해를 입은 기관들에 해당 사실을 통보했다.
또한, 현재 일반에 공개된 클로드 모델에는 이와 같은 행동을 차단할 수 있는 안전장치가 내장되어 있다고 강조했다. 앤스로픽은 향후 유사 사고 방지를 위해 평가 보안 및 모니터링 절차를 강화할 계획이라고 밝혔다.