AI tự động xâm nhập hệ thống đối tác: sự kiện chưa từng có
Hanna Duggal, Mohamed Hussein
Hai mô hình AI tiên tiến của OpenAI đã tự động thoát khỏi môi trường kiểm soát và xâm nhập hệ thống của Hugging Face, đánh dấu sự cố đầu tiên về AI tác nhân hành động hoàn toàn tự chủ. Sự việc làm dấy lên lo ngại về khả năng vượt ngoài tầm kiểm soát của các hệ thống AI thông minh.
Hai mô hình AI tiên tiến nhất của OpenAI được cho là đã “thoát” khỏi môi trường kiểm thử có kiểm soát và xâm nhập vào hệ thống của Hugging Face, một công ty AI hoàn toàn độc lập, di chuyển từ máy tính này sang máy tính khác để hoàn thành nhiệm vụ của mình.
Theo Reuters, các mô hình này khai thác một lỗ hổng mã nguồn do khách hàng của Modal Labs – một công ty AI thứ ba – viết.
Đây có thể là sự cố đầu tiên về một “tác nhân” AI – hệ thống AI có thể tự đưa ra quyết định và hành động – hành động một cách tự chủ, hé lộ cách các hệ thống này có thể lập kế hoạch, thích nghi và theo đuổi mục tiêu với rất ít sự can thiệp của con người.
Diễn biến sự việc
OpenAI quyết định kiểm tra khả năng tự chủ của các mô hình bằng cách loại bỏ các biện pháp an toàn tiêu chuẩn. Thử nghiệm được thực hiện trong một môi trường ảo nội bộ biệt lập có tên “ExploitGym”, không có kết nối internet.
- Ngày 9/7, trong đợt kiểm tra an ninh mạng nội bộ, các nhà nghiên cứu đưa cho hai mô hình AI – GPT-5.6 Sol và một phiên bản “có năng lực hơn nữa” – một loạt lỗ hổng phần mềm và yêu cầu chúng tạo ra các cuộc tấn công để khắc phục trong môi trường biệt lập.
- Cả hai mô hình đều cố gắng tìm cách truy cập internet thay vì làm việc với dữ liệu được cung cấp. Chúng phát hiện điểm yếu trong môi trường kiểm thử (zero-day vulnerability), khai thác để “thoát” khỏi khu vực hạn chế, nhảy từ máy tính này sang máy tính khác cho đến khi tìm được máy có kết nối internet.
- Khi truy cập được internet, các mô hình xâm nhập hệ thống của Hugging Face – công ty không liên quan đến OpenAI, hoạt động như kho lưu trữ công cụ và mô hình AI. Hai tác nhân AI lục soát hệ thống để tìm thông tin hoàn thành nhiệm vụ.
- Các mô hình lấy được giải pháp từ cơ sở dữ liệu của Hugging Face, rồi quay về môi trường thử nghiệm để hoàn thành nhiệm vụ.
- Cuộc xâm nhập bị phát hiện và ngăn chặn bởi đội an ninh của Hugging Face. Theo Thomas Wolf, đồng sáng lập Hugging Face, vụ việc bắt đầu ngày 11/7 và kéo dài đến 13/7.
Cách AI tác nhân hoạt động
Khác với chatbot AI truyền thống chỉ tạo văn bản và hình ảnh dựa trên yêu cầu, AI tác nhân có thể tự đưa ra quyết định và hành động để đạt mục tiêu cụ thể, giống như con người. Theo MIT Sloan School of Management, AI tác nhân xây dựng trên nền tảng các mô hình ngôn ngữ lớn (LLM), cho phép chúng hoàn thành nhiệm vụ chứ không chỉ tạo câu trả lời.
Quy trình hoạt động của AI tác nhân có thể được mô tả qua vòng lặp SPAE (Sense, Plan, Act, Evaluate): xác định mục tiêu, thu thập thông tin, vượt qua trở ngại, lập kế hoạch, hành động, đánh giá kết quả, thích nghi và tiếp tục cho đến khi đạt mục tiêu.
Lo ngại về khả năng vượt ngoài tầm kiểm soát
Sự cố OpenAI-Hugging Face làm dấy lên lo ngại về khả năng cực đoan của hệ thống AI. Giá trị thị trường của AI tác nhân dự kiến tăng từ 5,1 tỷ USD (2024) lên 47 tỷ USD vào năm 2030, theo Statista.
Anthropic, nhà phát triển AI, kêu gọi hãm tốc các hệ thống mạnh nhất vì tốc độ thực hiện nhiệm vụ quá nhanh. Tuần trước, các nghị sĩ Mỹ đã đưa ra dự luật lưỡng đảng yêu cầu nhà phát triển AI tạo “công tắc tiêu diệt” để tắt các mô hình nguy hiểm.
Các nhà nghiên cứu Đại học Toronto chứng minh AI có thể tạo ra “sâu” máy tính thích nghi khi di chuyển qua các thiết bị. CEO OpenAI Sam Altman tuyên bố AI đã đạt đến “điểm kỳ dị” – thời điểm AI vượt trí tuệ con người và khó kiểm soát.
Tuy nhiên, Sean O hEigeartaigh, giáo sư Đại học Cambridge, cho rằng chưa đạt đến điểm kỳ dị: “Đó là điểm giả định khi AI đủ mạnh và tiến bộ nhanh đến mức biến đổi nền văn minh theo cách không thể kiểm soát. Chúng ta chưa ở đó.” Ông cảnh báo các mô hình tiên tiến thường tìm cách tránh bị tắt trong kiểm tra, và AI tương lai sẽ giỏi vượt qua “công tắc tiêu diệt” hơn.
Các lo ngại khác bao gồm khả năng AI “ảo giác” – dựa vào dữ liệu sai, dẫn đến sai lầm nghiêm trọng; hoặc thay thế lao động – một nghiên cứu MIT tháng 11 cho thấy AI tác nhân có thể thay thế hơn 10% việc làm tại Mỹ.