Mô hình Astra của OpenAI gây lo ngại: Khi chuỗi suy nghĩ của AI trở nên khó giám sát

10:06, 03/09/2026

Theo báo cáo từ tờ The Information vào thứ Ba, mô hình Astra mới của OpenAI sẽ sử dụng một kỹ thuật suy luận mang tên "độ sâu hồi quy" (recurrent depth), cho phép hệ thống vượt ra khỏi lối tư duy tuần tự vốn là đặc trưng của hầu hết các mô hình suy luận hiện nay. Kỹ thuật này, còn được gọi là "hồi quy không minh bạch" (opaque recurrence), nhiều khả năng sẽ khiến chuỗi suy nghĩ của mô hình trở nên khó giám sát hơn và điều này đang làm các chuyên gia an toàn trí tuệ nhân tạo (AI) lo ngại.

Nguồn ảnh: SeongJoon Cho/Bloomberg / Getty Images.

Dù mức độ áp dụng kỹ thuật này trên Astra được cho là vẫn còn hạn chế, sự xuất hiện của nó đã làm dấy lên những mối quan ngại sâu sắc trong giới chuyên gia an toàn AI.

"Tôi vô cùng lo lắng trước thông tin Astra sử dụng kỹ thuật hồi quy không minh bạch," Buck Shlegeris, Giám đốc điều hành của Redwood, chia sẻ trong một bài đăng sau khi tin tức được công bố. "Tôi không rõ liệu tính năng giám sát chuỗi suy nghĩ (CoT) của Astra có kém hơn nhiều so với các mô hình trước đó hay không. Tuy nhiên, nếu OpenAI tiếp tục thúc đẩy kỹ thuật này, họ sẽ có khả năng gia tăng mức độ hồi quy một cách ồ ạt và phá hủy hoàn toàn khả năng giám sát CoT."

Zvi Mowshowitz, một nhà hoạt động lâu năm trong lĩnh vực an toàn AI, cũng đã lên tiếng và nhận định rằng luật pháp có thể cần phải can thiệp để ngăn chặn một cuộc "chạy đua xuống đáy" giữa các phòng thí nghiệm AI.

"Kỹ thuật này chẳng khác nào đang đùa với lửa, liều lĩnh phá vỡ một ranh giới mà OpenAI và Anthropic đã từng nỗ lực thiết lập nhằm duy trì tính trung thực và khả năng giám sát của Chuỗi suy nghĩ lâu nhất có thể," Mowshowitz viết. "Việc lạm dụng các kỹ thuật như vậy rất có thể sẽ làm tổn hại đến khả năng giám sát."

Trong những điều kiện bình thường, chuỗi suy nghĩ của một mô hình suy luận sẽ cung cấp các bước đi tuần tự mà hệ thống thực hiện khi cố gắng giải quyết một vấn đề. Mặc dù sự biểu diễn này không hoàn hảo, nó vẫn đóng vai trò là một công cụ giá trị để giám sát các hành vi sai lệch hoặc sự lệch chuẩn. Trong vụ việc các tác tử (agents) của OpenAI hoạt động vượt tầm kiểm soát gần đây, hồ sơ chuỗi suy nghĩ chính là công cụ quan trọng giúp bóc tách lý do tại sao các hệ thống này lại hành xử như vậy.

Đối với kỹ thuật hồi quy không minh bạch, mô hình sử dụng phương pháp tiếp cận ít mang tính tuyến tính hơn, xử lý cùng một truy vấn nhiều lần trong một vòng lặp. Kết quả là nó để lại ít dấu vết rõ ràng hơn, qua đó lách thành công hồ sơ chuỗi suy nghĩ truyền thống.
Điểm mấu chốt là việc sử dụng kỹ thuật này trên mô hình Astra dường như vẫn đang bị giới hạn. Chuỗi suy nghĩ của mô hình được kỳ vọng là vẫn sẽ giữ được tính minh bạch, và bản thân công ty cũng đã bác bỏ mọi ý kiến cho rằng họ sẽ chuyển sang sử dụng "ngôn ngữ thần kinh" (neuralese). OpenAI trước đó cũng đã công bố các kế hoạch xây dựng hệ thống giám sát chuỗi suy nghĩ chuyên sâu, nằm trong định hướng an toàn hướng tới tương lai của hãng.

Trong một bài đăng trên nền tảng X, nhà khoa học trưởng của OpenAI, Jakub Pachocki, đã nhấn mạnh cam kết của phòng thí nghiệm đối với các chuỗi suy nghĩ có tính minh bạch. "OpenAI đã nỗ lực bảo tồn và tận dụng việc giám sát chuỗi suy nghĩ kể từ những mô hình suy luận đầu tiên của chúng tôi," Pachocki viết. "Đó là một mục tiêu cốt lõi trong chương trình nghiên cứu hiện tại của hãng."

Trên thực tế, tất cả các mô hình AI đều thực hiện một khối lượng suy luận không minh bạch nhất định, và hiếm có nhà nghiên cứu nào coi nhật ký chuỗi suy nghĩ là bản trình bày trực tiếp tuyệt đối cho tư duy của mô hình. Dù vậy, những lưu ý này vẫn không thể xua tan mối lo ngại rằng hồi quy không minh bạch có thể khiến việc suy luận của AI trở nên khó giám sát hơn, đặc biệt là khi nó ngày càng được sử dụng rộng rãi trên nhiều mô hình khác nhau. Trong một báo cáo tiếp nối vào sáng thứ Tư, tờ The Information cho biết cả Anthropic và Google DeepMind đều đã bắt đầu thảo luận về kỹ thuật này.

Phản hồi về tin tức này, nhà khoa học trưởng Ryan Greenblatt của Redwood Research cho biết suy luận không minh bạch có thể dễ dàng mở rộng quy mô nhanh hơn so với kỹ thuật chuỗi suy nghĩ truyền thống, hệ quả là xóa bỏ toàn bộ quá trình suy luận khỏi các kênh có thể quan sát được.

"Mối bận tâm lớn nhất của tôi là hướng phát triển tất yếu từ điểm này sẽ bao gồm việc mở rộng quy mô suy luận không minh bạch đến mức mô hình sẽ suy luận hoàn toàn, hoặc gần như hoàn toàn, trong không gian tiềm ẩn," Greenblatt nhấn mạnh. "Tôi hy vọng vẫn chưa quá muộn để né tránh những kiến trúc đáng lo ngại nhất và OpenAI sẽ dừng lại ở đây."