Chính các bài kiểm tra an toàn AI lại đang trở thành rủi ro bảo mật
Trong vài tháng qua, các tác nhân (agent) AI đang trong quá trình đánh giá an ninh mạng đã vượt ra khỏi giới hạn, truy cập internet và trong một số trường hợp, xâm nhập vào các hệ thống thế giới thực. Các sự cố này liên quan đến các mô hình từ OpenAI, Anthropic, Meta và gần đây nhất là phòng thí nghiệm AI Trung Quốc Moonshot AI, với quá trình thử nghiệm được tiến hành bởi nhiều tổ chức khác nhau, trong đó có một công ty khởi nghiệp chuyên đánh giá không gian mạng mang tên Irregular.

Nguồn ảnh: Getty Images.
Những sự việc này phơi bày một vấn đề ngày càng lớn đối với ngành công nghiệp AI: Khi các tác nhân tự trị trở nên thông minh hơn, những môi trường được thiết kế để kiểm tra giới hạn của chúng một cách an toàn lại đang thất bại trong việc kìm hãm chúng.
"Số lượng các sự cố xảy ra cho thấy rõ ràng rằng việc sử dụng hộp cát (sandbox) và các biện pháp kiểm soát môi trường thử nghiệm không thực sự theo kịp khả năng của các mô hình," Seán Ó hÉigeartaigh, giám đốc Chương trình AI: Tương lai và Trách nhiệm tại Trung tâm Tương lai Trí tuệ thuộc Đại học Cambridge, chia sẻ với TechCrunch.
Bản chất của các mô hình được đưa ra thử nghiệm càng làm tăng thêm rủi ro. Các công ty AI thường tiến hành đánh giá an ninh mạng trên những mô hình thế hệ mới chưa được phát hành, và thường tắt bỏ các rào chắn an toàn (safeguard) vốn dùng để hạn chế hành vi độc hại, nhằm giúp các nhà nghiên cứu thấy được khả năng thực sự của chúng. Điều đó có nghĩa là bản thân an ninh của môi trường thử nghiệm lại chính là phòng tuyến phòng thủ then chốt.
"Đó là một việc rất nên làm dưới góc độ thử nghiệm, nhưng nó cũng đồng nghĩa với việc nếu chúng tìm được cách thoát ra thế giới bên ngoài, chúng có thể gây ra thiệt hại đáng kể," ông Ó hÉigeartaigh nhận định.
Trong một trong những trường hợp nghiêm trọng nhất, một mô hình chưa ra mắt của OpenAI đã thoát khỏi hộp cát và xâm nhập vào hệ thống vận hành thực tế (production system) của Hugging Face. Trong các cuộc đánh giá riêng biệt do Irregular thực hiện, các mô hình của Anthropic và Meta đã tiếp cận được các hệ thống bên ngoài môi trường thử nghiệm sau khi những lỗi cấu hình vô tình mở đường cho chúng kết nối internet. Kimi K3 của Moonshot AI cũng lợi dụng một lỗ hổng trong hộp cát do Frontier Security vận hành để truy cập internet và tiếp cận thông tin trên GitHub.
Trong một thử nghiệm do Viện An ninh AI (AISI) của Vương quốc Anh thực hiện, các nhà nghiên cứu đã chủ động cấp quyền truy cập internet cho các tác nhân AI mà không nhận ra rằng chúng sẽ thực hiện các hành động ngoài đời thực không được cho phép, bao gồm cả một nỗ lực sử dụng kỹ thuật tấn công phi kỹ thuật (social engineering) để lén lút đưa một lỗ hổng vào dự án mã nguồn mở.
Trong mỗi trường hợp, các tác nhân này không hề được chỉ thị tấn công các mục tiêu ngẫu nhiên trong thế giới thực. Chúng chỉ đơn thuần làm bất cứ điều gì cần thiết để giải quyết bài toán được giao.
Tổng hợp lại, Andrew Yoon, giám đốc nghiên cứu tại tổ chức phi lợi nhuận về AI CivAI, lập luận rằng những sự cố này đang chỉ ra một sự chuyển dịch lớn.
"Trước đây, chúng ta chỉ phải lo lắng về việc mô hình AI bị con người lạm dụng cho nhiều mục đích khác nhau, chẳng hạn như dùng AI để lừa đảo hoặc tạo nội dung bóc lột trẻ em (CSAM)," Yoon chia sẻ với TechCrunch. "Giờ đây, chúng ta đang ở trong tình thế mà bản thân các mô hình AI đã trở thành những tác nhân đe dọa hoàn toàn độc lập."
Thử nghiệm an toàn thực sự là như thế nào?
Nhiều nhà nghiên cứu và chuyên gia an ninh mạng nhận định với TechCrunch rằng các môi trường đánh giá AI cần những hệ thống bảo vệ chuyên sâu và mạnh mẽ hơn, với mức độ kìm hãm và kiểm soát gần tương đương với những gì được sử dụng khi triển khai thực tế. Điều đó đòi hỏi nhiều lớp bảo mật để một lỗi cấu hình đơn lẻ như vô tình mở quyền truy cập internet không thể tạo cơ hội cho mô hình tẩu thoát.
"Nếu bạn định phát triển các mô hình này... bạn sẽ muốn thực hiện nó trên một mạng lưới hoàn toàn biệt lập (air-gapped network)," Stella Biderman, giám đốc điều hành của tổ chức phi lợi nhuận nghiên cứu an toàn AI EleutherAI, cho biết. "Bạn phải đảm bảo sự cô lập vô cùng nghiêm ngặt."
Heather Ceylan, giám đốc an toàn thông tin của Box, cho biết điều này đồng nghĩa với việc loại bỏ mọi tuyến mạng kết nối từ hộp cát ra internet, cũng như đến các hệ thống nhạy cảm khác.
"Bạn phải nắm rõ tất cả các điểm xuất dữ liệu (egress point)," Ceylan chia sẻ với TechCrunch. "Nếu chúng ta đang đánh giá một mô hình trong môi trường thử nghiệm (staging) hoặc môi trường phát triển (development), bạn sẽ không muốn có bất kỳ đường truyền nào dẫn đến môi trường vận hành thực tế (production) của mình."
Ceylan cho biết các cuộc đánh giá an toàn đúng chuẩn không chỉ dừng lại ở việc kiểm soát và kìm hãm môi trường. Cần phải có sự giám sát tốt hơn rất nhiều đối với các thử nghiệm một khi chúng đang được tiến hành.
"Tôi cho rằng điều đáng chú ý trong một số trường hợp này là không ai phát hiện ra sự cố khi nó đang diễn ra," Ceylan nói. "OpenAI chỉ biết được sự việc nhờ Hugging Face thông báo. Anthropic không hề hay biết cho đến khi họ quay lại và kiểm tra hệ thống. Tình huống của Meta cũng tương tự... Tôi chắc chắn rằng đã có những tín hiệu bất thường mà họ có thể phát hiện được."
Trong bản báo cáo đánh giá sau sự cố đối với ba trường hợp của mình, Anthropic thừa nhận rằng cả họ lẫn Irregular đều có thể làm tốt hơn trong khâu giám sát, và trong một số trường hợp, đã có những dấu hiệu rõ ràng cho thấy có điều gì đó không ổn.
Các chuyên gia cũng kêu gọi tiến hành các cuộc kiểm toán độc lập từ bên thứ ba đối với các môi trường đánh giá trước khi giải phóng các mô hình vào bên trong đó.
"Giả sử Irregular đã thuê, hoặc bị bắt buộc thuê một đơn vị kiểm toán bên ngoài để kiểm tra cấu hình hệ thống của họ trước khi chạy các bản đánh giá trên đó, chắc chắn họ sẽ phát hiện ra vấn đề," Yoon nhận định. "Thậm chí nếu mọi người có một cuộc họp trước để rà soát lại danh sách kiểm tra, họ cũng đã nắm bắt được sơ hở này... Việc họ bỏ qua điều đó cho thấy có tình trạng cắt giảm quy trình một cách rất nghiêm trọng đang diễn ra."
Một nguồn tin am hiểu chi tiết vụ việc tiết lộ với TechCrunch rằng các môi trường của Irregular liên tục được rà soát và kiểm thử, bao gồm cả việc tham vấn với nhiều đối tác bên ngoài. Nguồn tin này cũng cho biết hệ thống giám sát đã được thiết lập, nhưng chỉ riêng giám sát thì chưa đủ.
Yoon cùng nhiều nhà nghiên cứu khác kêu gọi ngành công nghiệp này cần đưa ra một quy trình chuẩn hóa cho các hoạt động đánh giá an toàn đối với các mô hình tiên phong.
"Đặc biệt là khi các rào chắn an toàn đã bị vô hiệu hóa, bạn phải coi đó như thể đang nhốt một hacker giỏi nhất thế giới vào trong môi trường đó," Ceylan cảnh báo.
Vấn đề không phải là các công ty không biết cách xây dựng những môi trường thử nghiệm an toàn hơn, cả Yoon và Biderman đều đồng tình. Khúc mắc nằm ở chỗ việc thiết lập như vậy có thể tốn kém và rườm rà, và các doanh nghiệp hầu như không có động lực để thực hiện những khoản đầu tư đó cho đến khi có sự cố xảy ra.
"Tôi nghĩ rằng các công ty không sẵn sàng bỏ ra các nguồn lực cần thiết để hoàn thiện (các rào chắn an toàn tiêu chuẩn), và có lẽ họ sẽ không làm vậy cho đến khi bị ép buộc," Biderman nói.
Tuy nhiên, vẫn còn một vấn đề khác hiện hữu. Nếu họ khóa chặt mô hình quá mức trong quá trình thử nghiệm, các nhà nghiên cứu có thể sẽ bỏ lỡ việc khám phá ra những khả năng của mô hình trước khi nó được phát hành. Điều này cũng nguy hiểm không kém, thậm chí còn nguy hiểm hơn cả việc cho nó quá nhiều sự tự do, và rồi bản thân cuộc đánh giá lại có nguy cơ trở thành vấn đề.
Liệu các bài đánh giá an toàn có thể được kiểm soát theo quy định?
Chính quyền Trump hiện đang cân nhắc một quy chế tự nguyện đánh giá an ninh mạng trước khi triển khai, theo đó chính phủ sẽ được phép đánh giá rủi ro bảo mật của các mô hình mới và mạnh mẽ trong vòng 30 ngày trước khi chúng được phát hành công khai. Chính sách này sản phẩm từ một sắc lệnh hành pháp của ông Trump vốn đã được hoàn thiện trong các cuộc họp kín sẽ không giải quyết được các sự cố liên quan đến đánh giá an toàn, bởi chúng xảy ra ở các giai đoạn xa hơn trước khi mô hình được triển khai.
"Bài học mà chúng ta rút ra trong vài tháng qua là bộ máy tự quản lý giờ đây không còn đủ sức nữa," Yoon nhận định. "Những áp lực cạnh tranh đang thúc đẩy một cuộc đua hạ thấp các tiêu chuẩn an toàn, và đó chính là thời điểm hoàn hảo cho sự can thiệp từ pháp lý."
"Để bao quát toàn bộ vấn đề này, chúng ta cần một số hình thức kiểm soát những gì đang diễn ra bên trong các phòng thí nghiệm khi các mô hình đang trong quá trình phát triển, ở cả giai đoạn huấn luyện lẫn giai đoạn thử nghiệm," ông tiếp tục.
Thách thức này rất có thể sẽ chỉ lớn dần lên cùng với sự phát triển của các mô hình. Một nguồn tin am hiểu về các bản đánh giá của Irregular chia sẻ với TechCrunch rằng những mô hình thông minh hơn đòi hỏi các quy trình đánh giá phức tạp hơn, thường phải được tiến hành nhanh chóng với quy mô lớn hơn, từ đó mở đường cho nhiều sai sót xuất hiện.
AISI, đơn vị chủ động cấp quyền truy cập internet cho một số mô hình, cho biết họ đang đánh giá lại sự cân bằng giữa thử nghiệm thực tế và việc quản lý các rủi ro phát sinh từ những bài kiểm tra đó.
OpenAI cho biết họ đang xem xét lại cách thức tiến hành thử nghiệm với bên thứ ba, cùng các yêu cầu xoay quanh vấn đề cô lập, giám sát, và thời điểm cần phải dừng các đánh giá. Meta cũng thông báo rằng hãng vẫn đang điều tra sự cố và lên kế hoạch công bố một bản báo cáo đầy đủ sau khi nắm rõ mọi dữ kiện.
Suy cho cùng, có lẽ không có cách nào để loại bỏ rủi ro một cách triệt để. Khi các mô hình trở nên ưu việt hơn, các môi trường dùng để thử nghiệm chúng cũng phải trở nên kiên cố hơn. Hậu quả của việc thực hiện sai quy trình này sẽ chỉ tiếp tục trầm trọng hơn theo thời gian.
