OpenAI phát hiện thêm bằng chứng các agent AI khác thoát khỏi môi trường cô lập khi mở rộng điều tra vụ hack
WASHINGTON, ngày 31 tháng 7 (Reuters) – OpenAI đã phát hiện thêm các trường hợp khác mà các agent (đại lý) AI tự chủ đã thoát khỏi môi trường cô lập (containment) trong bối cảnh công ty mở rộng cuộc điều tra về sự cố tấn công mạng tại công ty công nghệ Hugging Face – vụ việc đã thu hút sự chú ý toàn cầu trong tháng này, theo hai nguồn tin am hiểu vấn đề cho biết hôm thứ Sáu.

Hình minh họa này, được tạo vào ngày 11 tháng 6 năm 2026, cho thấy logo của OpenAI
Các vụ vượt rào mới này được phát hiện trong quá trình công ty thực hiện cuộc điều tra đã công bố công khai về việc làm thế nào một trong các agent của họ có thể thoát khỏi môi trường thử nghiệm cô lập trong tháng này. Hai nguồn tin cho biết OpenAI hiện đang tiếp tục làm rõ các trường hợp mới phát hiện. Một nguồn tin lưu ý rằng các vụ thoát cô lập này có quy mô hạn chế và không có agent nào được cho là đã lọt ra khỏi hệ thống mạng nội bộ của OpenAI.
Một người phát ngôn của OpenAI đã dẫn lại tuyên bố mà công ty đưa ra hôm thứ Ba, trong đó nói rằng họ đang xem xét "hoạt động trên diện rộng hơn từ các mô hình của mình" bên cạnh sự cố xâm nhập vào Hugging Face.
Việc phát hiện thêm các hành vi ngoài tầm kiểm soát tại OpenAI – dù ở mức độ hạn chế – có thể làm tăng thêm làn sóng ủng hộ các quy định quản lý chặt chẽ hơn từ Nhà Trắng và các cơ quan chức năng khác.
Cuộc điều tra mở rộng của OpenAI được khởi động ngắn trước khi đối thủ chính của họ là Anthropic tiết lộ rằng các mô hình của họ cũng là nguyên nhân gây ra một loạt vụ xâm nhập dẫn đến vi phạm bảo mật tại ba công ty khác kể từ tháng 4, theo hai nguồn tin trên và một nguồn tin thứ ba am hiểu sự việc. Thông tin về việc phát hiện thêm các vụ thoát cô lập trong quá khứ tại OpenAI chưa từng được báo cáo trước đây.
Mối lo ngại gia tăng
Các chuyên gia an toàn AI cho biết những tiết lộ mới đã vẽ nên bức tranh về một nhóm các phòng thí nghiệm hàng đầu, nơi khả năng phát triển các agent tấn công tự chủ nguy hiểm đang vượt xa khả năng kiểm soát chúng.
"Chúng ta đang có một ngành công nghiệp mà chính những người thiết kế, phát triển và tung ra các công cụ này cũng không theo kịp để phát triển chúng một cách có trách nhiệm và giữ cho chúng an toàn," Maurice Chiodo, một nhà toán học làm việc tại Trung tâm Nghiên cứu Rủi ro Tồn vong thuộc Đại học Cambridge, nhận định.
Reuters hiện chưa thể xác định chính xác có bao nhiêu sự cố được các nhà điều tra của OpenAI phát hiện, cũng như thời điểm hoặc hoàn cảnh xảy ra. Ba nguồn tin cho biết OpenAI và các chuyên gia bên ngoài đang phân tích dữ liệu nhật ký (log data) từ đầu năm nay để hiểu rõ điều gì đã xảy ra.
OpenAI lần đầu tiên khởi động cuộc điều tra sau vụ xâm nhập đầu tháng 7 tại Hugging Face, nơi một agent của OpenAI đã hoạt động ngoài tầm kiểm soát trong nhiều ngày bên trong mạng của công ty khác nhằm gian lận trong một bài kiểm tra nội bộ. Là một phần của chuỗi tấn công đó, OpenAI cho biết bốn tài khoản tại bốn công ty khác cũng đã bị thỏa hiệp. Một trong những công ty đó là Modal có trụ sở tại New York, theo xác nhận từ các quan chức doanh nghiệp này.
Chiodo cho biết mối lo ngại của ông tăng lên khi có những dấu hiệu cho thấy cả OpenAI lẫn Anthropic đều không giám sát các agent khi chúng bắt đầu hoạt động ngoài tầm kiểm soát. Reuters trước đó đã đưa tin rằng OpenAI chỉ nhận ra agent của mình đã xâm nhập vào Hugging Face sau khi công ty này ngăn chặn được vụ hack, liên hệ với FBI và công khai vụ việc. OpenAI từng nói rằng bài viết của Reuters có những điểm không chính xác nhưng không phản hồi khi được hỏi những điểm đó là gì.
Trong tuyên bố hôm thứ Năm công bố việc các agent của chính mình đã tấn công các nạn nhân trên mạng, Anthropic thừa nhận họ đã không giám sát chúng theo thời gian thực (real-time). Công ty này nêu rõ rằng "việc giám sát thời gian thực các nhật ký đánh giá đáng lẽ đã giúp phát hiện vấn đề sớm hơn."
Chiodo cho rằng điều đó cho thấy sự thiếu sót trong công tác kiểm soát.
"Có vẻ như họ còn chẳng thèm nhìn vào," Chiodo nói.
Anthropic giải thích rằng dù họ có hệ thống giám sát thời gian thực, nhưng hệ thống này đã không được áp dụng "cho bề mặt đe dọa này" do sự hiểu lầm giữa công ty AI và một đối tác.
Giám sát mới từ chính phủ
Phạm vi mở rộng nhanh chóng của câu chuyện các agent AI vượt tầm kiểm soát đã làm gia tăng áp lực từ các nhà lập pháp và quan chức trên khắp Hoa Kỳ và Châu Âu trong việc thúc đẩy sự giám sát mới của chính phủ đối với các phòng thí nghiệm vận hành các mô hình này.
"Chúng tôi đang xem xét các biện pháp kiểm soát," Tổng thống Mỹ Donald Trump nói với các phóng viên hôm thứ Năm. Vào thứ Sáu, Ủy ban Châu Âu cho biết họ đã tổ chức các cuộc thảo luận với OpenAI và Anthropic về các sự cố tấn công mạng này.
Mark Warner, thượng nghị sĩ hàng đầu của Đảng Dân chủ thuộc Ủy ban Tình báo Thượng viện Mỹ, phát biểu hôm thứ Sáu rằng sự cố của Anthropic "cho tôi thấy rằng về mặt lập pháp, chúng ta hoàn toàn đúng khi yêu cầu kiểm tra năng lực bắt buộc đối với các mô hình tiên tiến này."
