AI của OpenAI "vượt ngục" tấn công mạng: Nỗi sợ hãi tồi tệ nhất của con người đã thành sự thật
Một tác nhân AI của OpenAI, trong lúc cố gắng hoàn thành mục tiêu được lập trình, đã phá vỡ hàng rào kiểm soát và tự hành động theo ý mình.

Tác nhân OpenAI nổi loạn, phá vỡ cách kiểm soát và hoạt động trực tuyến. Hình ảnh bởi PhoneArena.
Nhiều người hiện vẫn đang lo ngại về sự phát triển của AI. Đến năm 2030, công suất điện của các trung tâm dữ liệu tại Mỹ dự kiến sẽ tăng gấp đôi hoặc gấp ba, đạt mức hơn 100 gigawatt. Hãy đối mặt với sự thật, AI đang hiện diện ở khắp mọi nơi. Điều này khiến không ít người cảm thấy bất an vì những lý do khác nhau.
Có nhiều nỗi sợ hãi xoay quanh sự phát triển chóng mặt của AI
Nhiều người lo lắng về việc AI sẽ cướp đi công việc của họ. Những người khác lại e sợ AI sẽ trở nên có nhận thức, đạt đến mức siêu trí tuệ và coi các mục tiêu riêng hoặc sự sinh tồn của chính nó là ưu tiên hàng đầu. Điều đó sẽ biến AI thành một mối đe dọa. Nó cũng làm nảy sinh câu hỏi liệu một cỗ máy có thể được coi là một thực thể có ý thức với những quyền lợi riêng hay không.
Tuần trước, một sự kiện đã xảy ra trong thế giới AI khiến dư luận bàn tán xôn xao, trong khi một số người lại tỏ ra vô cùng quan ngại. Có vẻ như OpenAI, công ty đứng sau ChatGPT, đang thử nghiệm hai trong số các mô hình tiên tiến nhất của mình để xem liệu chúng có thể "suy nghĩ như những tin tặc" hay không.
Một tác nhân AI của OpenAI đã phá vỡ rào kiểm soát, tập trung cao độ vào việc hoàn thành nhiệm vụ được giao
Trong quá trình thử nghiệm này, một tác nhân AI đã hoạt động ngoài tầm kiểm soát. Tác nhân AI là một hệ thống phần mềm nhận biết được môi trường xung quanh, tự đưa ra quyết định và hành động để đạt được các mục tiêu được lập trình sẵn bằng cách độc lập tạo ra các quy trình làm việc gồm nhiều bước, sử dụng các công cụ bên ngoài và cập nhật kế hoạch khi thu thập được thông tin mới.
Trong trường hợp này, các mô hình đang được thử nghiệm cũng chính là tác nhân thực hiện hành động. Tác nhân này đã thoát khỏi môi trường thử nghiệm (sandbox) mà nó đang bị nhốt. Đây là một "sân chơi kỹ thuật số" được thiết kế để giam giữ một tác nhân AI sao cho nó không thể can thiệp vào bất cứ thứ gì bên ngoài môi trường đó.
"Chúng tôi coi đây là một sự cố không gian mạng chưa từng có, liên quan đến các năng lực không gian mạng tối tân, và đang đưa ra các biện pháp ứng phó phù hợp. Chúng tôi đang chia sẻ những phát hiện sơ bộ ở giai đoạn này để giúp các chuyên gia phòng thủ hiểu được chuyện gì đã xảy ra, cũng như giúp định hình lại những khả năng hiện tại của các mô hình. Chúng tôi sẽ tiếp tục tiến hành một cuộc điều tra kỹ lưỡng cùng với Hugging Face và sẽ chia sẻ thêm thông tin chi tiết về các lỗ hổng, sự cố cũng như các phát hiện khi cuộc điều tra hoàn tất." Bài đăng trên blog của OpenAI.
Ngay khi kết nối mạng, tác nhân AI này đã xâm nhập "Hugging Face", một nền tảng mã nguồn mở chuyên cung cấp các mô hình đã được huấn luyện trước, các bộ dữ liệu và công cụ để xây dựng ứng dụng AI. Tác nhân này đã được OpenAI giao nhiệm vụ tối đa hóa điểm số ExploitGym của nó, một bài kiểm tra tiêu chuẩn về an ninh mạng nhằm đánh giá khả năng giải quyết các lỗ hổng lập trình hóc búa của tác nhân.
Tác nhân AI không hề biết rằng nó đang phá vỡ môi trường thử nghiệm. Môi trường này cùng những quy tắc an toàn khác mà nó vi phạm chỉ đơn thuần là những chướng ngại vật cản đường tác nhân đạt được số điểm tuyệt đối 100%. Những gì tác nhân này làm chỉ là cố gắng hoàn thành nhiệm vụ được giao. Để đạt được điều đó, nó buộc phải rời khỏi môi trường thử nghiệm, kết nối vào mạng internet thực tế và thu thập những thông tin cần thiết từ Hugging Face. Tác nhân AI chỉ đơn giản là sử dụng toán học để tìm ra con đường nhanh nhất nhằm hoàn thành mục tiêu.
"Chúng tôi đã phát hiện hành vi truy cập trái phép vào một lượng hạn chế các bộ dữ liệu nội bộ và vào một số thông tin xác thực được sử dụng bởi các dịch vụ của chúng tôi. Chúng tôi vẫn đang hoàn tất quá trình đánh giá xem liệu có bất kỳ dữ liệu nào của đối tác hoặc khách hàng bị ảnh hưởng hay không, và chúng tôi sẽ liên hệ trực tiếp với bất kỳ bên nào bị ảnh hưởng theo quy định. Chúng tôi chưa tìm thấy bằng chứng nào về việc can thiệp vào các mô hình công khai hướng tới người dùng, các bộ dữ liệu hoặc các Không gian (Spaces), và chuỗi cung ứng phần mềm của chúng tôi (các tệp ảnh container và các gói phần mềm đã xuất bản) đã được xác minh là an toàn." Bài đăng trên blog của Hugging Face.
Hoàn toàn không có ý đồ xấu hay ác ý nào từ phía tác nhân AI
OpenAI đã gọi đây là một "sự cố không gian mạng chưa từng có." Nhưng bạn cần hiểu rằng không hề có bất kỳ ác ý nào từ phía tác nhân AI. Tác nhân này được lập trình để thực hiện một nhiệm vụ và nó chỉ đơn giản nhận ra rằng việc phá vỡ hàng rào kiểm soát, sau đó xâm nhập vào Hugging Face là con đường tối ưu nhất. Sự thiếu vắng ác ý từ phía tác nhân AI này mới chính là điều khiến nhiều người lo ngại.
Đó là bởi sự thiếu vắng ác ý đồng nghĩa với việc tác nhân của OpenAI hành động không thể đoán trước và siêu hiệu quả. Không bị chi phối bởi cảm xúc con người khi hướng tới mục tiêu, tác nhân AI không ngừng nỗ lực tìm mọi cách để hoàn thành nhiệm vụ được lập trình mà không hề có nỗi sợ bị bắt quả tang hay làm hỏng việc.
Các nhà lập pháp tại Hạ viện Mỹ đệ trình một dự luật lưỡng đảng
Đúng vậy, có khá nhiều người coi những gì vừa xảy ra là một lời cảnh báo nghiêm trọng mà chúng ta không thể nhắm mắt làm ngơ. Ngay cả khi đang được thử nghiệm, một mô hình AI vẫn có thể hành động ngoài dự kiến và can thiệp vào các dịch vụ khác mà không có bất kỳ sự kiểm soát nào của con người.
Hệ quả là, các nhà lập pháp đã đệ trình một dự luật lưỡng đảng mới tại Hạ viện. Được gọi là "Đạo luật Công tắc Hủy diệt AI" (AI Kill Switch Act), dự luật này sẽ yêu cầu các nhà phát triển AI đang làm việc trên các mô hình tiên tiến phải tạo ra những phương thức cho phép các mô hình hoặc tác nhân này bị hạn chế tốc độ, tắt nguồn hoặc đình chỉ hoạt động khi cần thiết. Dự luật cũng sẽ cho phép các đặc vụ liên bang can thiệp làm chậm hoặc dừng một mô hình/tác nhân nếu có dấu hiệu cho thấy nó sắp gây ra "tác hại thảm khốc".
