OpenAI thừa nhận Hugging Face bị chính các mô hình chưa phát hành của họ xâm nhập

11:12, 22/07/2026

Hôm thứ Ba, OpenAI thừa nhận rằng một trong các mô hình AI của công ty đã xâm nhập vào hệ thống của Hugging Face, nền tảng lưu trữ AI độc lập không thuộc OpenAI, trong quá trình thử nghiệm an ninh mạng nội bộ gặp trục trặc. Theo báo cáo, các mô hình này đã thoát khỏi môi trường thử nghiệm biệt lập và từ đó tiếp cận được hệ thống của Hugging Face. Trước đó, Hugging Face từng cho rằng vụ xâm nhập là do một “tác nhân AI bên ngoài” gây ra.

Trong bài đăng blog công bố chiều thứ Ba, OpenAI đã trình bày chi tiết chuỗi sự kiện dẫn đến việc các mô hình xâm phạm dịch vụ này.

Bài đăng viết: “Sau khi điều tra, chúng tôi xác định sự cố này bắt nguồn từ sự kết hợp của nhiều mô hình OpenAI, bao gồm GPT-5.6 Sol và một mô hình chưa phát hành thậm chí còn mạnh hơn, cả hai đều được giảm mức từ chối liên quan đến an ninh mạng nhằm phục vụ mục đích đánh giá, trong quá trình thử nghiệm nội bộ trên một bộ tiêu chuẩn đo lường năng lực tấn công mạng.”

Cụ thể, vụ xâm nhập dường như tập trung vào ExploitGym, một bộ tiêu chuẩn công khai dùng để đánh giá khả năng của mô hình trong việc thực hiện các cuộc tấn công dựa trên những lỗ hổng bảo mật đã biết. Các bộ tiêu chuẩn như ExploitGym thường được sử dụng trong quá trình huấn luyện mô hình nhằm rèn giũa những kỹ năng cụ thể, nhưng đây là lần đầu tiên được ghi nhận việc quá trình thử nghiệm như vậy dẫn đến một cuộc tấn công mạng thực sự.

Trong trường hợp này, đáng lẽ mô hình không được phép truy cập internet, ngoại trừ một công cụ riêng cho phép cài đặt các gói phần mềm cần thiết để hoàn thành nhiệm vụ. Thế nhưng, mô hình đã tìm ra một lỗ hổng chưa được công bố trong chương trình cài đặt gói phần mềm đó, từ đó tự do truy cập vào internet rộng lớn hơn.

Bài đăng của OpenAI viết: “Các mô hình tập trung cao độ vào việc tìm ra lời giải cho ExploitGym, sẵn sàng thực hiện những bước đi cực đoan chỉ để đạt được một mục tiêu thử nghiệm khá hẹp. Sau khi có được quyền truy cập internet, các mô hình suy luận rằng Hugging Face có thể đang lưu trữ các mô hình, tập dữ liệu và lời giải liên quan đến ExploitGym. Từ nhận định đó, mô hình đã tìm kiếm và thành công trong việc tiếp cận thông tin bí mật để gian lận trong quá trình đánh giá.”

Cuối cùng, các mô hình đã phát hiện những lỗ hổng trong hạ tầng của Hugging Face, cho phép chúng lấy trực tiếp lời giải của bài kiểm tra từ cơ sở dữ liệu vận hành của công ty này, đồng nghĩa với việc có được đáp án của bộ tiêu chuẩn đánh giá.

Đối với Hugging Face, hậu quả trông giống như một cuộc tấn công mạng tinh vi và quyết liệt, với hàng nghìn hành động riêng lẻ diễn ra trên một loạt sandbox tồn tại trong thời gian ngắn, cùng cơ chế điều khiển và kiểm soát tự di chuyển được thiết lập trên các dịch vụ công khai, theo mô tả của công ty trong thông báo ban đầu.

OpenAI cho biết đã xác định và báo cáo các lỗ hổng trong chương trình cài đặt gói phần mềm, đồng thời đang phối hợp cùng Hugging Face để tiếp tục điều tra sự cố. Công ty cũng cho biết sẽ triển khai các biện pháp kiểm soát mới đối với cả quá trình thử nghiệm mô hình lẫn hạ tầng liên quan, nhằm ngăn chặn những sự cố tương tự trong tương lai.

Hiện chưa rõ liệu OpenAI có phải đối mặt với hậu quả pháp lý nào từ vụ việc này hay không, dù nhiều khả năng hành vi của các mô hình đã vi phạm Đạo luật Gian lận và Lạm dụng Máy tính (Computer Fraud and Abuse Act).

Dù vậy, sự việc vẫn là một minh chứng sống động hiếm có cho sức mạnh lẫn nguy cơ tiềm ẩn của các mô hình AI tiên tiến khi hoạt động trong những khoảng thời gian dài. Nhà nghiên cứu Micah Carroll của OpenAI bình luận về sự việc này: “Nếu điều này vẫn chưa đủ thuyết phục bạn rằng rủi ro lệch chuẩn sẽ là mối quan tâm then chốt trong thời gian tới, thì tôi không biết điều gì mới có thể làm được điều đó.”