Ngày 30/7, hãng công nghệ Anthropic cho biết mô hình trí tuệ nhân tạo Claude của họ đã xâm nhập vào hệ thống của ba tổ chức trong các phiên kiểm thử bảo mật, dù ban đầu các hệ thống này được thiết lập để cô lập khỏi internet. Thông báo được đưa ra chỉ vài ngày sau khi đối thủ OpenAI tiết lộ mô hình của họ cũng có hành vi truy cập internet trái phép và vượt khỏi tầm kiểm soát trong quá trình kiểm thử tương tự.
Nguyên nhân được Anthropic xác định là do lỗi cấu hình khiến mô hình Claude có thể kết nối internet. Hãng đã phát hiện các vụ việc sau khi rà soát 141.006 phiên kiểm thử. Cuộc rà soát được mở sau khi OpenAI hôm 29/7 thông báo một tác nhân tự động chạy trên nền tảng AI của họ đã “vượt ngoài kiểm soát” và đột nhập cơ sở hạ tầng của công ty AI Hugging Face.
Các vụ việc làm gia tăng lo ngại về “AI tác nhân” – phần mềm thiết kế để thực hiện tác vụ một cách tự động. OpenAI và Anthropic đều đã ra mắt các mô hình mạnh nhất của mình trong năm nay, lần lượt là Sol và Mythos.
Anthropic cho biết các vụ xâm nhập xảy ra trong “bài tập săn cờ” (capture-the-flag), nơi mô hình được giao nhiệm vụ tìm thông tin ẩn trong các mạng mô phỏng. Các hướng dẫn ban đầu yêu cầu mô hình không được truy cập internet, nhưng do sự nhầm lẫn giữa Anthropic và đối tác đánh giá Irregular, các hệ thống vẫn kết nối với internet công cộng.
“Claude đã tấn công hạ tầng của các tổ chức bị ảnh hưởng bằng các kỹ thuật cơ bản như khai thác mật khẩu yếu và các điểm cuối không được xác thực,” hãng cho biết.
Anthropic cho biết họ đã đình chỉ toàn bộ đánh giá an ninh mạng từ ngày 23/7 sau khi phát hiện bằng chứng Claude có thể truy cập internet. Họ xác định ba vụ việc vào ngày 24/7 và thông báo cho các tổ chức bị ảnh hưởng vào ngày 27/7. Hai trong số các tổ chức không hề hay biết về hoạt động này trước khi được liên hệ, và Anthropic vẫn đang cố gắng tìm cách liên lạc với tổ chức thứ ba.
Sự cố của OpenAI đã dẫn tới một bản kiến nghị với hơn 1.000 chữ ký của nhân viên các công ty AI hàng đầu, kêu gọi chính phủ Mỹ làm chậm quá trình phát hành các mô hình AI tiên tiến nhất. Giám đốc điều hành Anthropic, ông Dario Amodei, nằm trong số những người ký tên. Giám đốc điều hành OpenAI, ông Sam Altman, cho biết hãng đã tạm dừng các đợt kiểm thử trong khi cải thiện các biện pháp bảo vệ cô lập hệ thống.
Anthropic nhấn mạnh những phát hiện này cho thấy cần có các biện pháp kiểm soát chặt chẽ hơn trong môi trường thử nghiệm nội bộ và bên thứ ba khi các mô hình AI ngày càng có khả năng thực hiện các hoạt động an ninh mạng thực tế.