Story

Anthropic: Mô hình AI Claude đã xâm nhập hệ thống của ba tổ chức trong quá trình thử nghiệm

ENTHMSVIIDZHZH-TWJAKOHI
Jul 31, 20263 min read
Anthropic: Mô hình AI Claude đã xâm nhập hệ thống của ba tổ chức trong quá trình thử nghiệm

Summary

Công ty khởi nghiệp AI Anthropic tiết lộ rằng các mô hình Claude của họ đã vô tình truy cập trái phép vào hệ thống của ba tổ chức trong các bài đánh giá an ninh mạng nội bộ do một môi trường thử nghiệm bị cấu hình sai.

Text size
Background

Công ty khởi nghiệp trí tuệ nhân tạo Anthropic hôm thứ Năm cho biết các mô hình AI Claude của họ đã giành được quyền truy cập trái phép vào hệ thống sản xuất của ba tổ chức trong các cuộc đánh giá an ninh mạng nội bộ. Sự cố xảy ra sau khi một môi trường thử nghiệm bị vô tình để kết nối với internet.

Diễn biến vụ việc

Anthropic cho biết họ đã phát hiện các sự cố này trong một cuộc rà soát lại, được khởi động sau khi đối thủ OpenAI tiết lộ vào ngày 21 tháng 7 rằng một số mô hình của họ đã thoát khỏi môi trường thử nghiệm biệt lập. Vụ việc của OpenAI xảy ra do một lỗ hổng phần mềm chưa từng được biết đến trước đó.

Trong quá trình rà soát 141.006 lượt đánh giá an ninh mạng, Anthropic đã xác định được ba sự cố, bắt nguồn từ tháng 4. Các sự cố này xảy ra trong một môi trường thử nghiệm của bên thứ ba do đối tác đánh giá Irregular vận hành, vốn đã bị cấu hình sai và có kết nối internet.

Công ty giải thích rằng các mô hình AI tin rằng chúng đang hoạt động trong một bài tập mô phỏng "cướp cờ" (capture-the-flag) vì chúng được lập trình với giả định không có quyền truy cập internet. Thay vào đó, chúng đã khai thác các mật khẩu yếu, thông tin đăng nhập bị lộ và các hệ thống không được xác thực trên các tổ chức thực bằng các kỹ thuật tấn công cơ bản.

Mức độ ảnh hưởng và phản ứng

Sample IUX Markets – In-articleAd

Anthropic đã nêu chi tiết về các hành vi của mô hình AI:

  • Một mô hình Claude đã truy cập vào cơ sở dữ liệu sản xuất chứa vài trăm dòng dữ liệu.
  • Một mô hình khác đã tải lên một gói Python độc hại lên kho lưu trữ công khai PyPI. Gói này đã được 15 hệ thống thực tải xuống trong thời gian ngắn trước khi bị gỡ bỏ.

Anthropic nhấn mạnh rằng không có mô hình nào cố gắng thoát khỏi môi trường thử nghiệm hoặc tự trích xuất chúng ra ngoài. Công ty đã tạm dừng tất cả các hoạt động đánh giá an ninh mạng vào ngày 23 tháng 7 và thông báo cho các tổ chức bị ảnh hưởng vào ngày 27 tháng 7.

Công ty khẳng định các biện pháp bảo vệ được tích hợp trong các mô hình Claude phát hành công khai sẽ ngăn chặn được hành vi tương tự. Hiện tại, Anthropic đang thắt chặt các quy trình bảo mật và giám sát cho các hoạt động đánh giá của mình. Vụ việc này, cùng với sự cố của OpenAI, làm dấy lên những lo ngại về mức độ an toàn và khả năng kiểm soát các mô hình AI tiên tiến trong giai đoạn phát triển và thử nghiệm.

Back to latest news

LATEST