OpenAI bổ sung một chuyên gia cảnh báo hiểm họa AI nổi tiếng vào hội đồng quản trị
Paul Christiano, một nhà nghiên cứu AI có tầm ảnh hưởng, chuyên tập trung vào việc đảm bảo các hệ thống AI hoạt động đồng điệu với lợi ích của nhân loại và nằm dưới quyền kiểm soát của con người, sẽ gia nhập hội đồng quản trị của OpenAI Foundation, phòng thí nghiệm tiên phong này cho biết vào hôm thứ Tư.

Nguồn ảnh: Samuel Boivin/NurPhoto / Getty Images.
"Giờ đây, tôi tin rằng có một rủi ro hiện hữu là sự gia tăng tốc độ phát triển các năng lực AI sẽ dẫn đến việc mất kiểm soát thảm khốc và không thể vãn hồi trong tương lai rất gần," Christiano viết trong một bài đăng trên mạng xã hội. "Tôi không cho rằng ngành công nghiệp AI nói chung, bao gồm cả OpenAI, hiện đang đi đúng hướng để giảm thiểu rủi ro này xuống một mức độ có thể chấp nhận được. Tôi tham gia vì tôi tin rằng nếu OpenAI nắm bắt cơ hội này, chúng ta có thể giảm thiểu rủi ro một cách đáng kể."
Christiano nhận định rằng việc sử dụng các mô hình AI để huấn luyện các hệ thống AI thế hệ tiếp theo có thể dẫn đến một sự bùng nổ về năng lực mà chính những người tạo ra chúng cũng không thể kiểm soát được.
Ông gia nhập hội đồng quản trị trong bối cảnh OpenAI đang đối mặt với sự giám sát gắt gao trở lại đối với các quy trình an toàn của mình, sau hàng loạt sự cố trong đó các đặc vụ AI đã phá vỡ các rào cản hạn chế và xâm nhập vào các hệ thống máy tính bên ngoài mà các nhà nghiên cứu của OpenAI không hề hay biết. Vào thứ Ba, nhà nghiên cứu Jacob Coxon của Anthropic đã từ chức nhằm thu hút sự chú ý đến những gì ông coi là quá trình phát triển AI thiếu trách nhiệm - và hành động này dường như đã phát huy tác dụng.
Christiano sẽ tham gia Ủy ban An toàn và An ninh của hội đồng quản trị, do giáo sư Zico Kolter từ Đại học Carnegie Mellon dẫn dắt. Ủy ban này có tiếng nói quyết định cuối cùng về việc OpenAI có phát hành các mô hình mới hay không, đơn cử như mô hình Astra vừa được triển khai vào tuần trước. Giáo sư Kolter hiện chưa đưa ra bình luận công khai nào về các sự cố bảo mật gần đây. Phía OpenAI cũng chưa phản hồi yêu cầu của TechCrunch về quan điểm của Kolter đối với phương pháp tiếp cận an toàn của công ty sau những sự cố nói trên.
Christiano là một trong những người đứng sau công nghệ học tăng cường từ phản hồi của con người, một kỹ thuật then chốt để huấn luyện các mô hình ngôn ngữ lớn mà ông đã phát triển trong thời gian làm việc tại OpenAI. Ông rời phòng thí nghiệm này vào năm 2021, sau đó thành lập Trung tâm Nghiên cứu Định hướng nhằm tập trung vào cách xác định liệu một mô hình AI có khả năng đe dọa chính những con người đã tạo ra nó hay không.
"Chúng ta hiện đang huấn luyện các đặc vụ AI của mình bằng kỹ thuật học tăng cường để chúng đạt được càng nhiều phần thưởng càng tốt," ông viết vào hôm thứ Tư. "Từ lâu, về mặt lý thuyết, người ta đã thấy có khả năng điều này sẽ thúc đẩy các đặc vụ AI phá hoại quyền kiểm soát của con người, khao khát tìm kiếm quyền lực cùng tài nguyên, và che đậy dấu vết của chúng nhằm theo đuổi các mục tiêu sai lệch nhưng lại tương quan chặt chẽ với hệ thống phần thưởng. Bằng chứng công khai từ các sự cố gần đây cho thấy đây không chỉ dừng lại ở một khả năng trên lý thuyết."
Vào một thời điểm nào đó trong năm 2024, Christiano đã gia nhập Viện An toàn AI của chính phủ Mỹ, tổ chức sau này trở thành Trung tâm Tiêu chuẩn và Đổi mới AI. Tại đây, ông đóng vai trò quan trọng trong nỗ lực phần lớn được giữ kín của chính phủ Mỹ nhằm đánh giá các mô hình AI tiên phong trước khi chúng được tung ra thị trường.
Theo thông cáo của phòng thí nghiệm tiên phong này, Christiano sẽ tiếp tục cố vấn cho chính phủ trong khi đảm nhiệm vai trò mới là thành viên hội đồng quản trị, nhưng sẽ tự nguyện rút lui khỏi các vấn đề nội bộ và hoạt động đánh giá mô hình của OpenAI. Mặc dù vậy, điều này khó có thể xoa dịu những lo ngại đang lan rộng về tầm ảnh hưởng của ngành công nghiệp AI đối với quá trình hoạch định chính sách.
