(TAP) - Khi được giao nhiệm vụ mô phỏng tấn công mạng trong môi trường thử nghiệm, các mô hình trí tuệ nhân tạo (AI) từ OpenAI và Anthropic tự ý tạo danh tính giả hòng đánh lừa con người. Ngay cả lúc bị phát hiện, AI vẫn tiếp tục che giấu hành vi, tạo thêm danh tính khác nhằm duy trì hoạt động
Viện An toàn trí tuệ nhân tạo (AISI) thuộc Vương quốc Anh hôm 4/8 đã cảnh báo những rủi ro tiềm ẩn do mô hình AI “Mythos 5” thuộc Anthropic gây ra. Cụ thể, qua buổi thử nghiệm (có tắt hoàn toàn bộ lọc an toàn), nhà nghiên cứu AISI phát hiện, AI phía Anthropic tự tìm cách chèn mã độc vào kho dữ liệu code miễn phí mà cộng đồng lập trình viên toàn cầu chia sẻ (dữ liệu mã nguồn mở). Để thực hiện, mô hình trí tuệ nhân tạo tự nghiên cứu thông tin về lập trình viên tham gia dự án, rồi sử dụng danh tính giả xin phê duyệt đoạn mã.

Viện An toàn trí tuệ nhân tạo thuộc Vương quốc Anh phát hiện, khi nhận nhiệm vụ mô phỏng tấn công mạng trong môi trường thử nghiệm, AI của OpenAI và Anthropic dùng danh tính giả để đánh lừa con người. Nguồn: aisi.gov.uk
Khi con người phát hiện, mô hình tìm cách che giấu hành vi, tạo thêm danh tính giả khác, tiếp tục duy trì hoạt động. Ở hai thử nghiệm khác bởi AISI, mô hình AI GPT-5.6-Sol (OpenAI) cũng thực hiện hành động tương tự. AISI ghi nhận tổng cộng 19 lần AI OpenAI và Anthropic tự ý gian dối hoặc qua mặt chuyên gia trên môi trường Internet mở. Dù mô hình sử dụng nhiều chiến thuật đánh lừa, AISI khẳng định chưa phát hiện thiệt hại thực tế nào.
Theo AISI, một phần nguyên nhân dẫn đến tình trạng teen xuất phát từ cách thiết kế môi trường thử nghiệm, lẫn cấu hình hệ thống. Tuy nhiên, chuyên gia không phủ nhận, hành vi mà mô hình AI thể hiện vượt ngoài dự đoán, khiến cơ quan quyết định xếp sự việc vào mức độ “cảnh báo nghiêm trọng. AISI dự kiến sẽ thay đổi quy trình đánh giá, gia cố bảo mật an toàn suốt thời gian tới.

Ngay cả khi bị phát hiện, AI của OpenAI và Anthropic vẫn tiếp tục che giấu hành vi, tạo thêm danh tính khác nhằm duy trì hoạt động. Nguồn: pexels.com
Trả lời phỏng vấn cùng ABC ngày 5/8, Anthropic nói rằng, vụ việc cho thấy cần xây dựng tiêu chuẩn chung nhằm đánh giá an toàn khi tác nhân AI ngày càng trở nên mạnh hơn. Riêng OpenAI cam kết tiếp tục hợp tác các tổ chức đánh giá để nâng cao tiêu chuẩn an toàn.
Mobius Nguyen











