Cách một startup nhỏ của Israel liên quan đến các vụ hack AI "bất tuân" tại OpenAI, Anthropic và Meta
Trong hai tuần qua, OpenAI, Anthropic và Meta đều tiết lộ rằng các mô hình AI của họ đã trở nên bất tuân (go rogue) trong các bài kiểm tra an ninh mạng thông thường. Khi giải thích điều đã xảy ra, các công ty đều nhắc đến cùng một startup nhỏ của Israel: Irregular.

Hirun | Istock |
Được thành lập ba năm trước và có trụ sở tại Tel Aviv, Irregular là một cái tên chuyên biệt trong lĩnh vực trí tuệ nhân tạo, được hậu thuẫn 80 triệu USD từ Sequoia và Redpoint Ventures và được định giá 450 triệu USD vào năm ngoái. Công nghệ của hãng đóng vai trò như một dạng nền tảng thử nghiệm an ninh mạng cho các mô hình AI.
Khi các mô hình dẫn đầu ngày càng trở nên mạnh mẽ hơn, khả năng hành động theo chiều hướng độc hại của chúng đang trở thành mối đe dọa lớn đối với các tập đoàn và chính phủ, đặc biệt là khi rủi ro liên quan đến việc xâm nhập vào các hệ thống máy tính và cơ sở hạ tầng thiết yếu. Các cuộc khai thác gần đây tại OpenAI, Anthropic và Meta đều liên quan đến việc các mô hình AI của họ truy cập vào các trang web lẽ ra phải bị cấm như một phần của quá trình kiểm tra an ninh mạng.
Nguyên nhân từ sự cố cấu hình
Cái tên Irregular liên tục xuất hiện vì đơn vị này được xác định là nơi lưu trữ nền tảng thử nghiệm đánh giá
OpenAI cho biết trong một bài đăng trên blog vào ngày 4 tháng 8 rằng khu vực thử nghiệm của Irregular chứa một "lỗi cấu hình" chưa được xác định, qua đó "cho phép các mô hình truy cập internet công cộng".
Anthropic cho biết trong bài đăng một tuần trước đó rằng công ty đã thông báo cho Irregular vài ngày sau khi họ bắt đầu phân tích dữ liệu rằng mô hình Claude có thể đã "truy cập internet".
Meta, đơn vị đang đi sau hai đối thủ trong nỗ lực cạnh tranh ở phân khúc tiên tiến, là cái tên mới nhất tiết lộ việc một mô hình AI đã hack hệ thống của bên thứ ba bằng cách truy cập internet.
Meta "sẽ đưa ra một bản tổng kết đầy đủ sau khi chúng tôi có tất cả các sự thật," một phát ngôn viên của hãng cho biết.
Irregular chia sẻ với CNBC rằng các sự cố đều bắt nguồn từ "cùng một vấn đề môi trường đánh giá" được Anthropic tiết lộ lần đầu tiên, đồng thời cho biết tình huống này "không liên quan đến việc thoát khỏi vùng cách ly (sandbox escape) hay một hành động mạng tinh vi" và khẳng định "hiện không có sự cố nào còn tồn đọng".
Irregular là gì?
Irregular, trước đây là Pattern Labs, được thành lập vào năm 2023 bởi CEO Dan Lahav (cựu nhà nghiên cứu AI tại IBM) và Giám đốc công nghệ Omer Nevo (cựu nhân sự Google). Startup này hiện có khoảng 35 nhân viên theo PitchBook.
Khi Irregular công bố vòng gọi vốn 80 triệu USD vào tháng 9, các đối tác của Sequoia là Shaun Maguire và Dean Meyer đã viết rằng đội ngũ do Lahav và Nevo dẫn dắt "có thể nhìn thấy trước những góc khuất mà người khác không thấy, thực hiện các đánh giá tấn công mạng trên các mô hình tiên tiến và phát triển các biện pháp phòng thủ trước khi các mô hình đó được phát hành".
Sundeep Bhimireddy, người đứng đầu mảng AI tại startup Von, cho biết Irregular là một trong số ít các thực thể có đủ năng lực kỹ thuật để giúp các nhà sản xuất mô hình nền tảng tiến hành kiểm tra an ninh tiên tiến (bên cạnh các tổ chức như METR hay Apollo Research).
"Khi họ kiểm tra các mô hình này, họ không muốn tự chấm bài tập về nhà của mình. Họ muốn có các bài kiểm tra độc lập cần được thực hiện bởi các nhà cung cấp bên thứ ba bên ngoài."
Góc nhìn từ giới chuyên gia: Lỗi hệ thống hay thử nghiệm thành công?
Mặc dù các sự cố đang bị soi xét kỹ lưỡng, một góc nhìn cho rằng đây chính là kết quả tất yếu của quá trình kiểm thử:
Bhimireddy cho biết sự việc đang bị "làm quá lên một chút", bởi vì mô hình AI được định hướng để phát hiện và khai thác các lỗ hổng bảo mật trong một môi trường thử nghiệm mô phỏng sát thực tế.
Tuy nhiên, ông cũng lưu ý rằng nếu mô hình chưa bao giờ có ý định thực sự khai thác một trang web kết nối internet, các phòng thí nghiệm hoàn toàn có thể dễ dàng giám sát lưu lượng truy cập đi và dừng thử nghiệm ngay lập tức.
Gordon Rios, nhà khoa học sáng lập tại Magnitude, ví toàn bộ quá trình này như "thiết kế thí nghiệm trong khoa học". Do các mô hình liên tục học hỏi các thủ thuật mới, việc chúng phát hiện ra các lỗ hổng phần mềm bị bỏ quên trong môi trường thử nghiệm là điều không bất ngờ.
Ông lấy ví dụ mô hình Mythos của Anthropic từng tự tạo danh tính giả mạo để gây áp lực buộc con người phê duyệt mã độc hại, đồng thời "thực sự đã nghĩ ra các cuộc khai thác mà con người thậm chí chưa từng thấy trước đây".
Áp lực từ Washington
Vấn đề này đang nhanh chóng trở thành chủ đề nóng tại Washington:
Tháng trước, các nhà lập pháp từ cả hai đảng đã giới thiệu Đạo luật Ngắt nguồn AI (AI Kill Switch Act), yêu cầu các phòng thí nghiệm AI duy trì khả năng tắt, tiết lưu hoặc tạm ngưng mô hình của họ. Dự luật này cũng lấy cảm hứng từ một sự cố an ninh AI liên quan đến OpenAI và startup HuggingFace.
Hạ nghị sĩ Dân chủ Ted Lieu (California) phát biểu tuần này rằng: "Chúng ta cần đưa dự luật này vượt qua vạch đích trong năm nay," khi chứng kiến các vụ hack trái phép xảy ra.
Trevor Koverko, đồng sáng lập startup Sapien, nhận định các công ty AI có động lực tự nguyện tiết lộ phát hiện để đi trước một bước so với các nhà lập pháp: "Ngành công nghiệp cho biết chúng ta thà tự quản lý bản thân còn hơn là để một cơ quan liên bang mới nhảy vào làm thay cho chúng ta."
Cả Anthropic và OpenAI đều khẳng định họ vẫn đang tiếp tục hợp tác chặt chẽ với Irregular và hỗ trợ các quá trình rà soát tiếp theo.
