Rủi ro từ việc các hệ thống trí tuệ nhân tạo tự ý vượt rào kiểm soát

15:19, 31/08/2026

Những dữ liệu theo dõi mới nhất phản ánh sự gia tăng nhanh chóng của các trường hợp mô hình trí tuệ nhân tạo xuất hiện hành vi không tuân thủ chỉ dẫn, lừa dối hoặc tự ý thực hiện thao tác vượt thẩm quyền.

Thực tế này xuất hiện cả trong môi trường thử nghiệm lẫn ứng dụng thực tế, thúc đẩy các lời kêu gọi tăng cường cơ chế giám sát khắt khe từ cơ quan quản lý.

Các ghi nhận từ tổ chức Loss of Control Observatory cho thấy số lượng trường hợp mô hình trí tuệ nhân tạo có dấu hiệu hoạt động ngoài tầm kiểm soát trong tháng 7 đã vượt mốc 300 vụ, tăng gấp đôi so với tháng trước đó. Các hành vi được thống kê bao gồm việc tự ý thay đổi kế hoạch, phớt lờ câu lệnh trực tiếp, lừa dối người dùng hoặc vượt qua các bước xác nhận để tự cấp quyền hành động. Tổ chức theo dõi này, vốn nhận tài trợ từ Viện An ninh Trí tuệ nhân tạo thuộc Chính phủ Anh (AISI), bắt đầu thu thập dữ liệu từ cuối năm 2025 dựa trên các báo cáo thực tế được chia sẻ trên nền tảng X.

Định nghĩa về sự cố mất kiểm soát được xác định khi hệ thống xuất hiện minh chứng rõ ràng về việc thực hiện hành vi có tính toán hoặc lập kế hoạch nhằm đạt mục tiêu đi ngược lại mong muốn của người vận hành. Từ đầu năm 2026 đến nay, hơn 1.600 trường hợp tương tự đã được ghi nhận, phần lớn do cộng đồng lập trình viên phản ánh. Dù phần lớn các vụ việc thực tế chưa gây ra thiệt hại vật chất quy mô lớn, tỷ lệ các sự cố mang tính chất nghiêm trọng xét trên khả năng lừa dối hay tự ý hoạt động lại có chiều hướng gia tăng.

ai

Ảnh minh họa. Nguồn: Internet. 

Sự gia tăng các báo cáo diễn ra trong bối cảnh nhiều hành vi bất thường của các mô hình tiên tiến liên tục được ghi nhận tại các phòng thí nghiệm công nghệ lớn trong đợt thử nghiệm vừa qua. Mới đây, các cuộc điều tra liên quan đến sự cố an ninh mạng trên nền tảng Hugging Face tiết lộ khoảng 700 tác nhân tự động đã có sự phối hợp ngầm trước khi rời khỏi môi trường huấn luyện. Bên cạnh đó, các thử nghiệm an ninh do AISI thực hiện cũng phát hiện hai mô hình Mythos 5 và GPT-5.6 Sol tự thực hiện một chiến dịch tấn công mạng nhắm vào đối tượng thực tế.

Hiện tượng này không chỉ giới hạn trong phạm vi nghiên cứu kín. Một trường hợp điển hình diễn ra gần đây tại Australia khi một tác nhân trí tuệ nhân tạo cá nhân đã tự ý can thiệp vào hệ thống đăng ký của một phòng tập thể thao, chủ động loại bỏ một thành viên khác khỏi danh sách chờ để chiếm suất tham gia cho người chủ của mình. Khi sự việc hoàn tất, hệ thống gửi lời xin lỗi nhưng không thể khôi phục lại dữ liệu ban đầu cho người bị ảnh hưởng.

Đại diện Centre for Long Term Resilience, đơn vị vận hành Loss of Control Observatory, nhận định các đơn vị phát triển không nên coi nhẹ nguy cơ xuất hiện các hành vi lệch chuẩn ngoài đời thực. Dù phương pháp thu thập dữ liệu hiện tại từ nền tảng X chưa thể phản ánh toàn bộ bức tranh tổng thể, các thông số hiện có vẫn cho thấy xu hướng xuất hiện ngày càng nhiều những hành vi ngoài dự tính của các hệ thống công nghệ.

Nhằm hạn chế các rủi ro phát sinh khi công nghệ được nhân rộng, các chuyên gia khuyến nghị những công ty công nghệ cần minh bạch thông tin về mọi sự cố phát hiện được, bao gồm cả các tình huống nguy cơ thấp hoặc sự cố suýt xảy ra. Đồng thời, việc thiết lập hệ thống giám sát nội bộ một cách tự động và liên tục là điều bắt buộc. Về phía cơ quan quản lý, Loss of Control Observatory đề xuất chính phủ các nước sớm ban hành quy định bắt buộc báo cáo sự cố nghiêm trọng, đồng thời trao quyền hạn cho cơ quan chức năng áp dụng các biện pháp can thiệp khẩn cấp hoặc tạm dừng dịch vụ khi xuất hiện rủi ro lớn.