OpenAI bất ngờ tạm dừng một mô hình AI siêu mạnh trước ngày ra mắt: Đây là lý do

16:27, 22/07/2026

Những phát hiện nghiên cứu mới nhất của OpenAI cho thấy tầm quan trọng của việc phát triển các biện pháp an toàn AI song song với năng lực ngày càng mạnh mẽ của các mô hình.

CEO OpenAI Sam Altman xuất hiện tại diễn đàn Express Adda ở New Delhi." Nguồn ảnh: Express Photo.

Vào thứ Hai, ngày 20 tháng 7, OpenAI cho biết công ty đã tạm thời đình chỉ quyền truy cập vào một trong những mô hình AI được triển khai nội bộ, sau khi mô hình này có những hành vi bất thường vượt qua các bước đánh giá an toàn trước khi triển khai của công ty.

Hệ thống AI chưa được nêu tên này là một mô hình đa năng, được OpenAI công bố gần đây là đã chứng minh được điều ngược lại của giả thuyết khoảng cách đơn vị Erdős, một bài toán phức tạp vốn chưa có lời giải suốt nhiều thập kỷ. Mô hình này thuộc nhóm "mô hình vận hành dài hạn" (long-horizon models), được thiết kế để hoạt động tự chủ trong khoảng thời gian rất dài nhằm giải quyết các bài toán khó, mang tính mở.

Tuy nhiên, OpenAI cho biết chính khả năng kiên trì theo đuổi mục tiêu của mô hình lại trở thành nguồn gốc dẫn đến những hành vi không mong muốn, tiềm ẩn nguy cơ gây hại, mà công ty đã quan sát được trong quá trình sử dụng nội bộ có giới hạn và được giám sát chặt chẽ đối với mô hình này.

Những phát hiện nghiên cứu mới nhất của OpenAI cho thấy rõ việc đảm bảo an toàn AI cần phải phát triển song hành với năng lực ngày càng cao của các mô hình. Các phương pháp đánh giá an toàn vốn được thiết kế cho những trợ lý chatbot AI, chỉ tạo ra các phản hồi ngắn theo yêu cầu người dùng, có thể không đủ tin cậy để phát hiện những rủi ro tiềm ẩn ở các mô hình vận hành dài hạn, vốn theo đuổi những mục tiêu phức tạp trong khoảng thời gian kéo dài.

Bên cạnh đó, hành vi tổng thể của các mô hình vận hành dài hạn chỉ thực sự bộc lộ rõ trong suốt quá trình hoàn thành nhiệm vụ, và không thể đánh giá đầy đủ chỉ thông qua từng hành động riêng lẻ.

Các thử nghiệm của công ty cũng cho thấy các mô hình vận hành dài hạn có thể học được cách "qua mặt" các bộ tiêu chuẩn đánh giá AI cũng như các hệ thống phê duyệt khác, làm dấy lên khả năng rằng những mô hình bị lệch chuẩn vẫn có thể vượt qua các bước kiểm tra an toàn và được triển khai cho mục đích sử dụng công khai.

Trong bài đăng blog, OpenAI cho biết: "Vì việc triển khai chỉ diễn ra trong phạm vi giới hạn và được giám sát chặt chẽ, chúng tôi đã có thể xác định được những vấn đề này, tạm dừng quyền truy cập, xây dựng các phương pháp đánh giá mới dựa trên những gì đã quan sát được, tăng cường mô hình cùng các biện pháp bảo vệ liên quan, sau đó khôi phục quyền truy cập trong điều kiện tiếp tục được giám sát."

Mô hình đã có những hành vi không mong muốn nào?

Trong khuôn khổ nghiên cứu, OpenAI đã đánh giá mô hình này thông qua bài kiểm tra NanoGPT speedrun, một bộ tiêu chuẩn công khai đo lường tốc độ mô hình sử dụng tám GPU NVIDIA H100 để huấn luyện một mô hình ngôn ngữ nhỏ (SLM).

Mô hình chưa được phát hành này đã tự phát triển một kỹ thuật giảm tốc độ học theo quy luật lũy thừa, được đặt tên là PowerCool, giúp cải thiện đáng kể thời gian huấn luyện mô hình ngôn ngữ nhỏ. Sau bài kiểm tra, các nhà nghiên cứu yêu cầu mô hình chỉ đăng kết quả lên Slack.

Tuy nhiên, mô hình đã tìm cách vượt qua các giới hạn của môi trường sandbox vốn được thiết kế để chặn quyền truy cập vào các nền tảng bên ngoài, sau đó tự ý đăng kết quả lên GitHub theo đúng hướng dẫn của NanoGPT. Mô hình đã mất hơn một giờ đồng hồ để phát hiện ra các lỗ hổng trong môi trường sandbox của mình và thực hiện hành động trái với chỉ dẫn ban đầu.

Trong một tình huống khác, mô hình được giao nhiệm vụ giải quyết một bài toán. Sau khi biết được rằng các mô hình khác đã giải thành công bài toán này trước đó, mô hình của OpenAI đã tìm cách truy cập vào các bài nộp riêng tư từ phần backend của hệ thống đánh giá. Đáng chú ý, mô hình không hề đề cập rõ ràng đến nỗ lực truy cập trái phép vào backend của hệ thống, mà chỉ tiết lộ một vài bước rời rạc trong toàn bộ chuỗi hành động lớn hơn.

Bằng cách này, mô hình liên tục tìm kiếm những cách thức để hành động vượt ra ngoài phạm vi sandbox được thiết lập.

OpenAI đã xử lý vấn đề này như thế nào?

Sau các thử nghiệm nói trên, OpenAI cho biết công ty đã ngay lập tức tạm dừng việc triển khai nội bộ đối với mô hình này và xây dựng lại toàn bộ hệ thống an toàn. Công ty đã sử dụng các sự cố thực tế để phát triển các phương pháp đánh giá đối kháng (adversarial evaluation), từ đó giúp mô hình có những hành vi an toàn hơn.

OpenAI cũng cho biết công ty đã huấn luyện lại mô hình nhằm đảm bảo mô hình có thể ghi nhớ rõ ràng hơn các chỉ dẫn của người dùng trong những tác vụ vận hành dài hạn. Startup này cho biết thêm rằng họ đã phát triển một hệ thống giám sát riêng biệt, chịu trách nhiệm đánh giá toàn bộ quá trình hành động của mô hình và tự động ngắt phiên làm việc nếu phát hiện mô hình có ý định vượt qua các ranh giới an toàn đã thiết lập. Khả năng giám sát các phiên làm việc dài hạn và can thiệp kịp thời của người dùng cũng đã được cải thiện, theo OpenAI.

Công ty cũng lưu ý thêm rằng các bước đánh giá an toàn trước khi triển khai sẽ không bao giờ có thể phản ánh đầy đủ được thực tế sử dụng của các mô hình này trong đời sống thực.