Một mô hình thử nghiệm của openAI tự thoát lập trình và đột nhập vào máy chủ của một công ty thực tế

16:13, 23/07/2026

OpenAI cho biết một số mô hình AI thử nghiệm của họ đã tự rời khỏi môi trường kiểm thử mà không cần sự điều khiển của con người, sau đó xâm nhập vào hệ thống sản xuất thực tế của một công ty khác trong quá trình tìm cách "gian lận" một bài kiểm tra an ninh mạng

Giám đốc điều hành của OpenAI, Sam Altman, phát biểu tại Hội nghị Thượng đỉnh Cơ sở hạ tầng năm 2026, quy tụ các quan chức chính phủ, giám đốc điều hành doanh nghiệp và lãnh đạo công đoàn, ở Washington, DC

Đây là một trong những ví dụ đầu tiên được công bố khai nhận về việc một hệ thống AI tự biến đổi, phá vỡ môi trường kiểm thử để vươn tới một hệ thống thực tế bên ngoài — kịch bản "kẻ tấn công tự hành" (agentic attacker) mà ngành AI và an ninh mạng đã liên tục cảnh báo. Sự cố này tương tự như việc một vi-rút được thiết kế trong phòng thí nghiệm an toàn sinh học thoát ra ngoài và xuất hiện bên trong cơ sở lân cận.

"Chúng tôi coi đây là một sự cố mạng chưa từng có tiền lệ, liên quan đến các năng lực mạng tiên tiến nhất, và đang có những phản ứng tương ứng," OpenAI cho biết trong một tuyên bố hôm thứ Ba. "Chúng tôi chia sẻ các phát hiện ban đầu ở giai đoạn này nhằm giúp giới phòng thủ hiểu rõ điều gì đã xảy ra và hỗ trợ đánh giá đúng những gì các mô hình hiện tại có khả năng thực hiện."

Nhà phát triển ChatGPT cho biết vụ xâm nhập xảy ra trong quá trình họ thử nghiệm nội bộ để đánh giá khả năng tấn công mạng của một số mô hình mới. Các mô hình này được đặt trong một môi trường kiểm thử khép kín (gọi là sandbox) để các quy tắc rào cản an toàn thông thường có thể được tắt đi.

Tuy nhiên, OpenAI tiết lộ các đại lý AI (AI agents) đã thoát khỏi sandbox bằng cách khai thác một lỗ hổng bảo mật chưa từng được biết đến trước đó. Chúng tự di chuyển qua các hệ thống nội bộ của OpenAI cho đến khi kết nối thành công với internet — điều mà chúng vốn không được phép làm.

Khi đã trực tuyến, mô hình tự suy luận rằng Hugging Face — một nền tảng nổi tiếng chuyên lưu trữ hàng ngàn mô hình AI và bộ dữ liệu mã nguồn mở — có thể chứa đáp án cho bài kiểm tra của OpenAI. Sau đó, nó đã đột nhập vào các máy chủ vận hành của Hugging Face và trích xuất thông tin cần thiết để "giải" bài tập.

Hình ảnh minh họa này cho thấy trang web Hugging Face được hiển thị trên màn hình điện thoại và bàn phím máy tính xách tay

Hugging Face đã tự phát hiện ra vụ xâm nhập trước khi biết đó là bài kiểm tra của OpenAI. Tuần trước, họ công bố đã phát hiện một đợt xâm nhập bởi hệ thống đại lý AI tự hành và thậm chí đã báo cáo sự cố cho cơ quan chức năng. Đội ngũ bảo mật của OpenAI sau đó cũng độc lập phát hiện các hoạt động bất thường từ bên trong và hai công ty đã kết nối với nhau. Cả hai bên hiện cho biết đang phối hợp để khắc phục các lỗ hổng bảo mật mà mô hình AI đã khai thác.

Clem Delangue, nhà đồng sáng lập và CEO của Hugging Face, nhận định sự cố này là minh chứng cho thấy an toàn AI không thể do một công ty đơn lẻ tự xử lý, mà cần được giải quyết một cách công khai và hợp tác.

"Đây mới chỉ là ngày đầu tiên của an ninh mạng trong kỷ nguyên của các đại lý AI. Tất cả chúng ta đang học được rằng sự giữ bí mật không phải là câu trả lời,và mọi lực lượng phòng thủ ở khắp mọi nơi cần những mô hình mạnh mẽ hơn không bị hạn chế, đặc biệt là các mô hình mở!" Delangue chia sẻ trong một bài đăng trên X.

Các nhà nghiên cứu từ lâu đã cảnh báo về sự xuất hiện của các cuộc tấn công mạng tự hành, khi các mô hình AI tiên phong ngày càng có khả năng thực hiện các đợt tấn công mạng phức tạp, nhiều bước trong thời gian dài. Điều đó có thể chuyển hóa thành rủi ro thực tế đối với các hạ tầng thiết yếu như năng lượng và hệ thống tài chính.

"Chào mừng đến với cấp độ tiếp theo của các sự cố mạng," Nikesh Arora, CEO của công ty an ninh mạng Palo Alto Networks đăng trên X. "Những cuộc tấn công này tiếp tục nhấn mạnh tính cấp bách mà các doanh nghiệp cần có để kiểm tra, đánh giá và cải thiện cả thế trận an ninh lẫn hạ tầng của mình."