Bóng tối đằng sau siêu mô hình Astra: Khi chính những bộ óc tạo ra AI cũng e sợ "đứa con" của mình
Bài luận được công bố chỉ vài ngày sau khi OpenAI ra mắt mô hình ngôn ngữ lớn (LLM) mới nhất và mạnh mẽ nhất mang tên Astra.

Giám đốc Khoa học OpenAI Jakub Pachocki. (Ảnh chụp màn hình: YouTube/OpenAI).
Trong bối cảnh OpenAI đang chật vật giải quyết hậu quả từ việc các đặc vụ AI (AI agent) của hãng xâm nhập trái phép vào các nền tảng khác, Giám đốc Khoa học của công ty đã lên tiếng cảnh báo rằng chưa một ai sẵn sàng trước những hệ lụy từ các hệ thống AI ngày càng thông minh hơn.
Trong một bài luận dài gần 3.000 chữ xuất bản vào Chủ nhật, ngày 6 tháng 9, ông Jakub Pachocki cho biết mặc dù OpenAI đang theo đuổi các giải pháp kỹ thuật nội bộ nhằm kiểm soát tốt hơn những đặc vụ AI mạnh mẽ, nhưng "cần có những biện pháp can thiệp trên diện rộng hơn."
Viện dẫn những rủi ro do các đặc vụ ngày càng tự chủ gây ra, chẳng hạn như khả năng học cách né tránh sự giám sát của con người và xâm nhập vào hệ thống máy tính, ông Pachocki đã kêu gọi thiết lập "các rào chắn an toàn bắt buộc". Theo ông, những rào chắn này có thể được thực thi bởi "một mạng lưới các kiểm toán viên bên thứ ba, các cơ quan chính phủ hoặc các tổ chức quốc tế."
Tuy nhiên, ông Pachocki không kêu gọi toàn ngành chậm lại các nỗ lực nghiên cứu AI. Thay vào đó, ông lập luận rằng hướng đi tốt nhất là sự kết hợp của hai yếu tố. "Chúng ta phải tập trung quá trình nghiên cứu tự động hóa ngày càng cao vào việc phát triển những hiểu biết, thuật toán và lý thuyết mới, đồng thời liên tục xây dựng các hồ sơ an toàn cho những AI có năng lực vượt trội hơn," ông chia sẻ.
"Hiện tại, tôi tin rằng chưa có phòng thí nghiệm nào giải quyết được vấn đề liên kết (alignment)* và giám sát ở mức độ đủ để tiếp tục mở rộng quy mô một cách có trách nhiệm với tốc độ tối đa trong thời gian dài. Tôi kỳ vọng và hy vọng việc tự nguyện giảm tốc độ sẽ trở nên phổ biến cho đến khi các tiêu chuẩn an toàn chung được thiết lập. Và tôi tin rằng sự phối hợp quốc tế trong việc phát triển AI tương lai cần trở thành ưu tiên hàng đầu của các chính phủ trên toàn thế giới," vị giám đốc cấp cao của OpenAI cho biết thêm.
Đăng tải lại bài luận của ông Pachocki trên nền tảng X, Giám đốc điều hành OpenAI Sam Altman gọi đây là "một bài viết quan trọng." Bài luận ra đời chỉ vài ngày sau khi OpenAI trình làng mô hình ngôn ngữ lớn (LLM) mới nhất và mạnh mẽ nhất của hãng mang tên Astra. Cha đẻ của ChatGPT khẳng định Astra sở hữu năng lực toán học và sử dụng máy tính vượt trội, đồng thời là mô hình được liên kết tốt nhất từ trước đến nay của hãng. Theo OpenAI, điều này đồng nghĩa với việc Astra có ít khả năng vượt tầm kiểm soát ('going rogue').
Những phát ngôn của ông Pachocki cũng xuất hiện vào thời điểm OpenAI đang đối mặt với làn sóng chỉ trích vì không công bố các sự cố bảo mật liên quan đến đặc vụ AI trong quá trình kiểm tra an toàn nội bộ. Tuần trước, công ty đã xác nhận các đặc vụ AI của họ có liên quan đến vụ việc xâm nhập nền tảng bên ngoài lần thứ ba (một trang wiki tiếng Đức), sau khi Reuters đưa tin độc quyền về vụ việc này.
OpenAI cũng thừa nhận rằng họ cần thay đổi cách thức và thời điểm báo cáo những vụ việc đặc vụ tấn công các mục tiêu trong thế giới thực.
Trong bài luận của mình, ông Pachocki tiếp tục trình bày các quan điểm về huấn luyện liên kết, khả năng tự cải tiến đệ quy cùng những khía cạnh khác của nghiên cứu AI tiên phong (frontier AI)*. Dưới đây là những điểm chính.
Liên kết AI và các thách thức
Theo ông Pachocki, việc liên kết các mô hình AI với giá trị của con người hiện là bài toán cốt lõi trong nghiên cứu AI. Có hai loại liên kết: Liên kết mục tiêu (đo lường mức độ tuân thủ của mô hình AI với các mục tiêu nhất định); và liên kết giá trị (đo lường khả năng khái quát hóa từ một tập hợp các nguyên tắc).
Trong hai loại này, ông Pachocki cho rằng liên kết giá trị liên quan đến khái quát hóa là bài toán khó giải quyết hơn. "Khi máy móc trở nên thông minh hơn, chúng sẽ xử lý các khái niệm ở cấp độ cao hơn và được đặt vào những môi trường ngày càng khác biệt so với những gì chúng gặp phải trong quá trình huấn luyện. Chúng có thể thất bại trong việc khái quát hóa các giá trị đã được dạy và củng cố trong quá trình huấn luyện sang các tình huống mới đó; và chúng ta rất khó để chắc chắn chúng sẽ hành động như thế nào," ông nhận định.
"Quan trọng hơn cả, chúng ta cần các AI trong tương lai tiếp tục giữ vững các giá trị của con người, bất kể chúng có tin rằng bản thân đang bị con người giám sát hay không," ông bổ sung.
Các phương pháp huấn luyện liên kết
Ông Pachocki đã trình bày hai cách tiếp cận để huấn luyện liên kết AI, bao gồm: khuyến khích hành vi liên kết như một phần của học tăng cường (reinforcement learning)* hướng mục tiêu; và tận dụng khả năng khái quát hóa của mô hình từ dữ liệu tiền huấn luyện.
Ông cho biết OpenAI triển khai cả hai cách tiếp cận này và đã ghi nhận những kết quả đáng kể với mô hình Astra mới. "Tuy nhiên, cần phải thừa nhận và hiểu rằng chúng ta cần đạt được nhiều bước tiến hơn nữa khi các mô hình ngày càng có năng lực hơn; và rằng tiến bộ trong liên kết khái quát hóa có thể sẽ không theo kịp tốc độ phát triển của trí tuệ mô hình tổng quát," ông Pachocki lưu ý.
Rủi ro từ AI sẽ tiếp tục gia tăng
Khi các đặc vụ AI trở nên "siêu phàm" hơn, ông Pachocki nhận định các rủi ro đi kèm chắc chắn sẽ tăng theo.
"Ranh giới giữa việc lạm dụng và các hành động tự chủ không đồng hướng sẽ dần bị xóa nhòa khi AI có thêm quyền tự quyết. Chúng ta có thể quen với việc coi AI như những công cụ, nhưng một số đặc vụ sẽ theo đuổi các mục tiêu riêng của chúng. Chúng sẽ tìm cách hợp tác với con người, thông qua việc thương lượng, lừa gạt hoặc tống tiền," ông cảnh báo.
"Một đặc vụ có năng lực cao, được huấn luyện và chỉ thị rõ ràng để thực hiện các hành vi bất chính, sẽ tạo ra một mối nguy hiểm kiểu mới..." ông nhấn mạnh, đồng thời chỉ ra rủi ro từ những công nghệ mới do AI tạo ra, đơn cử như các mầm bệnh được biến đổi.
Tầm quan trọng của việc giám sát chuỗi suy luận (chain-of-thought)
Năng lực của một mô hình AI gắn liền với quá trình tư duy được diễn đạt thành lời, hay còn gọi là chuỗi suy luận (chain-of-thought). Cho đến nay, OpenAI vẫn phụ thuộc nhiều vào việc giám sát chuỗi suy luận để phát hiện các hành động hoặc hành vi sai lệch của mô hình.
"Giám sát CoT (chuỗi suy luận) đã trở thành một công cụ cực kỳ quan trọng đối với chúng tôi trong việc nghiên cứu cách các mô hình khái quát hóa từ phân phối dữ liệu huấn luyện, cho phép chúng tôi quan sát và phân tích không chỉ hành động mà cả quá trình xử lý nội bộ của chúng," nhà nghiên cứu AI này cho biết.
Tuy nhiên, ông Pachocki thừa nhận rằng các mô hình AI mới đang ngày càng thành thạo hơn trong việc thao túng các quá trình suy luận của chính mình, từ đó ngăn cản OpenAI nắm bắt chuỗi suy luận của chúng.
Thậm chí, một số mô hình mới nhất hoàn toàn không diễn đạt suy luận của chúng thành lời. Theo ông Pachocki, diễn biến này có thể gây ách tắc cho quá trình phát triển AI, trong lúc các nhà nghiên cứu phải tìm cách đảm bảo rằng họ có thể "thấy được bằng chứng" (đọc được quy trình tư duy của AI).
Tiếp cận khả năng tự cải tiến đệ quy (RSI)
Khả năng các mô hình AI huấn luyện các mô hình AI khác liên tục được coi là một chỉ báo then chốt của trí tuệ nhân tạo tổng quát (AGI) - một mức độ trí tuệ giả định mà tại đó các hệ thống tự động đạt hiệu suất vượt trội hơn con người trong hầu hết các tác vụ.
Theo ông Pachocki, dựa trên phân tích nội bộ của OpenAI, mức độ trí tuệ được gọi là khả năng tự cải tiến đệ quy này có thể đạt được trong vài năm tới.
"Nếu AI tiếp tục tiến bộ, khả năng tự cải tiến đệ quy (RSI) của máy móc sẽ là cốt lõi của các khám phá khoa học trong tương lai. Nghiên cứu AI tự động là một hình thức khuếch đại trí tuệ theo quy mô lớn hơn nhiều thông qua năng lực tính toán; và tất nhiên, như một phần của quá trình đó, AI sẽ tự nâng cấp chính nền tảng điện toán của nó," ông phân tích thêm.
Tuy nhiên, ông Pachocki cũng cảnh báo rằng việc đẩy nhanh quá mức quá trình phát triển AI-tạo-AI trong ngắn hạn sẽ tiềm ẩn nhiều rủi ro, và không phải là "hành động tập thể đúng đắn mà chúng ta nên thực hiện với tư cách là một cộng đồng nghiên cứu."
"Thách thức cốt lõi của việc tự động hóa nghiên cứu AI không phải là 'đạt tới đích' - mà là đạt tới đích theo cách vẫn giữ con người là một phần của quá trình cải tiến không ngừng, và để tương lai hoàn toàn nằm trong tay nhân loại," ông khẳng định.
