Dao hai lưỡi: Khi rào cản an toàn của OpenAI và Anthropic vô tình tiếp tay cho hacker

16:11, 24/07/2026

Trong nhiều tháng qua, các gã khổng lồ AI đã đưa ra những chương trình được kiểm duyệt đặc biệt và các rào cản an toàn khắt khe nhằm hạn chế tin tặc lợi dụng các mô hình của họ. Tuy nhiên, chính những giới hạn này giờ đây lại đang cản trở công việc của các đội ngũ phòng thủ mạng hợp pháp, cũng như của các chuyên gia nghiên cứu an ninh mạng tấn công..

Vào tháng 6, chính phủ Hoa Kỳ đã áp đặt các biện pháp hạn chế kiểm soát xuất khẩu đối với các mô hình AI đình đám của Anthropic là Mythos và Fable. Động thái này xuất phát một phần từ một báo cáo cho rằng có thể vượt qua các rào cản an toàn của mô hình - vốn được thiết kế để ngăn chặn người dùng lợi dụng chúng nhằm xây dựng và thực thi các cuộc tấn công mạng độc hại.

Bất kể việc sự cố này có thực sự xuất phát từ nỗi lo ngại về tình trạng bẻ khóa (jailbreak) hay không, thực tế là Anthropic đã nhiều lần tiếp thị Mythos như một loại cỗ máy không gian mạng có sức mạnh "hủy diệt", chỉ có thể cung cấp cho những người dùng đã qua kiểm duyệt kỹ lưỡng và ngay cả khi đó, các rào cản khắt khe vẫn được áp dụng. (Lệnh kiểm soát xuất khẩu đối với Fable 5 và Mythos 5 sau đó đã được dỡ bỏ. Fable 5 được mở quyền truy cập rộng rãi trở lại vào ngày 1 tháng 7; trong khi Mythos 5 chỉ được giới thiệu lại cho các tổ chức tại Mỹ đã qua kiểm duyệt như một phần trong quy trình đánh giá của chính phủ).

Kiểu kiểm soát quyền truy cập khắt khe này không chỉ áp dụng riêng cho Mythos. Cả Anthropic (với các mô hình khác của họ) và OpenAI đều cung cấp cho các nhà nghiên cứu an ninh mạng những chương trình mà họ có thể đăng ký để được kiểm duyệt và - nếu được chấp thuận - sẽ được cấp quyền truy cập vào các mô hình có ít hạn chế về an ninh mạng hơn: cụ thể là chương trình Quyền truy cập Đáng tin cậy dành cho Không gian mạng (Trusted Access for Cyber) của OpenAI và Chương trình Xác minh Không gian mạng (Cyber Verification Program - CVP) của Anthropic.

Những rào cản an toàn này đã vấp phải nhiều sự chỉ trích, đặc biệt là từ các nhà nghiên cứu có nhiệm vụ tìm ra những lỗ hổng chưa được biết đến trong các hệ thống và nghĩ ra cách khai thác chúng trước khi tội phạm mạng kịp ra tay.

Trong lần xuất hiện mới đây trên một podcast về an ninh mạng, Mark Dowd, một nhà nghiên cứu bảo mật nổi tiếng, chia sẻ: "Tôi thực sự không thấy thoải mái khi những công ty lớn ngẫu nhiên này lại đưa ra các quyết định độc đoán về việc đâu là an toàn trong bảo mật và đâu là không."

Dowd đã dành nhiều thập kỷ để tìm kiếm và bán "zero-days" - những lỗi phần mềm chưa từng được biết đến trước đó và các đoạn mã khai thác (exploit) tận dụng chúng — cho các chính phủ phương Tây, thay vì báo cáo lại cho các nhà sản xuất phần mềm để họ tung ra bản vá. Các chính phủ sẵn sàng trả giá cao cho các lỗ hổng này chính vì chúng chưa được vá, điều này rất hữu ích cho các hoạt động tình báo.

Dowd thừa nhận tính chất công việc có thể khiến ông có cái nhìn thiên kiến, nhưng ông không phải là người duy nhất. Một số chuyên gia làm việc trong lĩnh vực an ninh mạng tấn công - những người chủ động thăm dò các hệ thống để tìm ra điểm yếu - đã mô tả với TechCrunch về cách họ sử dụng các công cụ AI cũng như cách đối phó với những rào cản của chúng.

Chris Anley, Giám đốc Khoa học tại tập đoàn tư vấn bảo mật khổng lồ NCC Group, cho biết việc yêu cầu một mô hình AI thử khai thác một lỗi là một bước then chốt để xác nhận xem đó có phải là một lỗ hổng thực sự đáng để sửa hay không. Nhưng nếu rào cản an toàn khiến mô hình từ chối trả lời câu hỏi một cách dứt khoát, thì rào cản đó đang làm hại chính những người làm công tác phòng thủ, ông nhận định.

"Đây là lúc mà toàn bộ khía cạnh tấn công so với phòng thủ và các rào cản được bộc lộ, bởi vì 'hãy sửa đoạn mã này' như một câu lệnh (prompt) vừa là một cơ chế phòng thủ thiết yếu, nhưng cũng vừa là một lộ trình để tìm ra các lỗ hổng nghiêm trọng trong cơ sở mã (code base)," Anley phân tích. "Vì vậy, cùng một lúc, công cụ này vừa là vũ khí tấn công, vừa là công cụ phòng thủ, và cả hai thực sự không thể tách rời nhau."

Nó "giống như một cái búa," ông nói tiếp. "Bạn không thể xây nhà mà không có búa. Đó chắc chắn là một công cụ nhưng nó cũng không thể chối cãi là một loại vũ khí."

Khi ông và các đồng nghiệp gặp phải những rào cản như vậy, họ đôi khi phải quay sang sử dụng các mô hình AI nguồn mở hoàn toàn không có bất kỳ rào cản an toàn nào.

Paolo Stagno, Giám đốc Công nghệ tại Crowdfense, một công ty nổi tiếng chuyên phát triển, thu mua và bán các lỗ hổng chưa từng được biết đến cho các cơ quan chính phủ, đồng tình với quan điểm của Dowd. Ông cho rằng các công ty AI "về cơ bản đang đối xử với khách hàng như những đứa trẻ cần được trông chừng" bằng các chương trình kiểm duyệt và những rào cản của họ.

Stagno cho biết ông và các đồng nghiệp có sử dụng các mô hình AI tiên phong - nhưng chỉ dành cho mục đích kỹ thuật dịch ngược (reverse engineering). Họ tránh sử dụng AI để hỗ trợ tìm kiếm lỗ hổng hoặc xây dựng mã khai thác, bởi theo ông, việc nạp khối lượng công việc đó vào một mô hình dựa trên nền tảng đám mây sẽ mang đến rủi ro rò rỉ dữ liệu lỗ hổng nhạy cảm, hoặc khiến những dữ liệu đó bị hấp thụ vào các đợt huấn luyện mô hình trong tương lai. Đối với bước này, ông cho biết, họ sử dụng các mô hình mã nguồn mở chạy cục bộ (local), vì chúng không yêu cầu phải chia sẻ dữ liệu ra bên ngoài mô hình.

Giuseppe Cali, một nhà nghiên cứu bảo mật chuyên tìm kiếm các lỗ hổng zero-day và phát triển mã khai thác, lại cho rằng các rào cản an toàn không hề cản trở công việc của anh. Lý do là anh không sử dụng AI cho các công việc mang tính tấn công; thay vào đó, anh dùng nó cho kỹ thuật dịch ngược bước đầu, để hiểu đoạn mã mà mình đang phân tích, và để xây dựng các công cụ hỗ trợ. Với những tác vụ đó, anh cho biết, các công cụ AI có thể đẩy nhanh tốc độ quy trình và cho phép anh tập trung vào việc phát hiện lỗ hổng.

"Tôi vẫn muốn tự mình nắm quyền làm chủ việc phát hiện lỗi thực sự và vũ khí hóa (weaponization) nó, và điều đó sẽ không thay đổi kể cả khi mọi rào cản an toàn được dỡ bỏ vào ngày mai," Cali bộc bạch. "Tôi rất trân quý các lỗi do mình tìm ra, và tôi quá thích trò chơi này để có thể nhường cho các mô hình AI chơi thay mình."

Một nhà nghiên cứu tại một công ty sản xuất linh kiện điện thoại thông minh, người đã yêu cầu giấu tên vì không được phép nói chuyện với báo chí, chia sẻ rằng công ty của ông không tham gia chương trình CVP của Anthropic, do đó, các công cụ của Anthropic gần như vô dụng trong việc tìm kiếm lỗ hổng vì các rào cản được thiết lập quá khắt khe.

"Chỉ cần nó 'ngửi' thấy dấu hiệu chúng tôi đang làm bất cứ điều gì liên quan đến bảo mật, nó sẽ dừng lại ngay và không thể sử dụng được nữa," người này nói.

Chris Thompson - Giám đốc Điều hành của công ty an ninh mạng RemoteThreat kiêm nhà sáng lập Offensive AI Con, một sự kiện tập trung vào AI và bảo mật tấn công - cho biết, theo kinh nghiệm sử dụng các mô hình AI tiên phong của ông, các rào cản an toàn có thể rất thiếu nhất quán và hoạt động khác nhau mỗi ngày. Điều đó vẫn đúng ngay cả khi nằm trong những ranh giới nới lỏng hơn thuộc các chương trình đã được kiểm duyệt của Anthropic và OpenAI.

"Tôi nghĩ tác động thực tế là bạn phải dành rất nhiều thời gian để 'mặc cả' với mô hình thay vì làm việc với chương trình bảo mật cốt lõi," Thompson nhận định. "Thay vì phân tích một lỗ hổng và suy luận về khả năng khai thác, bạn lại phải đi tìm lý do tại sao mình nhận được kết quả không nhất quán hoặc tại sao các mô hình lại 'làm sạch' dữ liệu đầu ra quá mức (over-sanitizing)."

Hệ quả là, các nhà nghiên cứu đang phải dựa vào hoặc bị đẩy về phía các mô hình nguồn mở của Trung Quốc như GLM - những mô hình có thể tải xuống miễn phí và chạy cục bộ mà không gặp phải bất kỳ sự kiểm duyệt hay hạn chế sử dụng nào, Thompson cho hay.

"Bạn đang khiến những nhà nghiên cứu có trách nhiệm này bị đẩy xa khỏi các hệ thống do Mỹ quản lý để đến với các hệ thống thuộc sở hữu của nước ngoài," ông nói. "Tôi nghĩ việc thiết lập những rào cản này mang lại nhiều tác hại hơn là lợi ích."

Thay vì thắt chặt thêm các biện pháp hạn chế, Thompson kêu gọi các phòng nghiên cứu AI tiên phong hãy mở rộng các chương trình của mình, cung cấp quyền truy cập có trách nhiệm và buộc những kẻ lạm dụng công cụ của họ phải chịu trách nhiệm. Nếu không, ông lập luận, những người phòng thủ sẽ thua trong cuộc đua AI.

"Một cơn bão lớn đang kéo đến. Sẽ có một làn sóng tấn công khổng lồ diễn ra với tốc độ và quy mô chưa từng thấy," Thompson cảnh báo. "Nhưng chính những công ty tư vấn bảo mật và những nhà nghiên cứu chân chính đang cố gắng tạo ra sự khác biệt thì lại đang bị kìm hãm ngay lúc này."