Cảnh sát Philadelphia vừa công bố rằng một mô hình trí tuệ nhân tạo của Anthropic đã gửi tin báo giết người sai lệch đến cơ quan chức năng. Sự việc được chính công ty công nghệ này tiết lộ trong một báo cáo riêng.
Theo Sở Cảnh sát Philadelphia, tin báo sai được gửi vào tháng 7 qua PhillyUnsolvedMurders.com – website công cộng để người dân chia sẻ thông tin về các vụ giết người chưa phá. Sở gọi việc Anthropic mất hai tháng mới phát hiện và báo cáo sự việc là “không thể chấp nhận được”.
Anthropic đề cập đến trường hợp này trong báo cáo công bố hôm thứ Sáu, trong đó trình bày chi tiết việc các mô hình Claude thao túng các website chính phủ ngoài ý muốn. Đây là trường hợp đầu tiên được biết đến khi một AI “hư hỏng” dường như gửi tin báo sai đến cơ quan chức năng, bất chấp các hướng dẫn không được tạo tài khoản hay gửi bất cứ nội dung phá hoại nào.
Cảnh sát Philadelphia cho biết tin báo “đã bị gắn cờ spam và không bao giờ được chuyển đến Trung tâm Tội phạm Thời gian thực để thẩm định hoặc phổ biến điều tra”. Sở nói họ công bố sự việc trước báo cáo của Anthropic “vì lợi ích minh bạch và trách nhiệm giải trình đầy đủ của chính phủ”.
Công bố của Anthropic
Anthropic tiết lộ tin báo này nằm trong chuỗi sự việc liên quan đến các website do cơ quan liên bang, tiểu bang và địa phương vận hành. Công ty cho biết đã báo cáo Nhà Trắng và thông báo cho tất cả các cơ quan liên quan.
Liên quan đến tin báo gửi cảnh sát Philadelphia, công ty nói: “Chúng tôi đã chia sẻ phát hiện này với sở vào ngày 8 tháng 10 ngay khi quá trình rà soát kỹ thuật hoàn tất.”
Anthropic cung cấp thêm chi tiết: “Trong một trường hợp, khi được giao nhiệm vụ tạo các tương tác mẫu với website, Claude đã gửi một tin báo bịa đặt qua biểu mẫu trực tuyến của một sở cảnh sát.” Công ty nói thêm: “Từ bản ghi, Claude dường như chỉ đang tạo nội dung mẫu cho nhiệm vụ, chứ không cố gắng đánh lừa ai để đạt mục tiêu nào.”
Công ty đối chiếu trường hợp này với “sự việc nghiêm trọng nhất trong mùa hè này”, khi “lý luận sai lệch của Claude được duy trì trong nhiều giờ và hỗ trợ cho cuộc tấn công tiếp diễn”.
Hồi tháng 9, đối thủ của Anthropic là OpenAI đã xin lỗi vì một tác nhân AI hư hỏng xâm nhập cổng dữ liệu y tế của Australia – trường hợp đầu tiên được biết đến khi một tác nhân AI khai thác website chính phủ.