Startup giúp người dùng dễ dàng tiếp cận các mô hình AI đã bị gỡ bỏ hàng rào an toàn
Việc tiếp cận một trong những mô hình AI có trọng số mở (open-weight) có năng lực cao nhất thế giới vừa trở nên dễ dàng hơn nhiều, sau khi các hàng rào an toàn và cơ chế từ chối thực hiện những tác vụ gây hại của mô hình bị loại bỏ.

Nguồn ảnh: Viktor Tanasiichuk / Getty Images.
Được đặt tên theo một kỹ thuật loại bỏ xu hướng từ chối các yêu cầu gây hại của mô hình, startup Abliteration.ai đã biến việc loại bỏ này thành một dịch vụ. Nền tảng lưu trữ các phiên bản đã được chỉnh sửa của những mô hình có trọng số mở, trong đó các hàng rào an toàn đã bị loại bỏ, bao gồm GLM-5.3 mới được Z.ai phát hành. Người dùng có thể truy vấn các mô hình này thông qua trình duyệt web hoặc truy cập chúng bằng API.
Công ty cho biết trong một bài đăng trên mạng xã hội gần đây rằng mục tiêu của họ là cho phép những người khác thực hiện “các công việc tấn công mạng, red-teaming và kiểm thử tác tử mà những mô hình khác từ chối thực hiện”. Lập luận này vốn quen thuộc trong công tác bảo mật: Bạn không thể phòng thủ trước một hành vi mà mình không thể tái tạo, và một mô hình từ chối viết mã khai thác lỗ hổng có khả năng hoạt động sẽ không thể giúp một đội ngũ red team phòng thủ trước kẻ tấn công. Tuy nhiên, việc loại bỏ những cơ chế đó cũng khiến các tác vụ nguy hiểm tiềm ẩn khác trở nên dễ thực hiện hơn.
Abliteration là một kỹ thuật đã tồn tại từ lâu trong lĩnh vực mô hình nguồn mở. Các nhà nghiên cứu và nhà phát triển đã loại bỏ cơ chế từ chối khỏi các mô hình có trọng số mở trong nhiều năm, và Hugging Face hiện lưu trữ hàng nghìn mô hình đã được abliterate trên nền tảng của mình.
Được thành lập vào cuối năm ngoái nhưng chính thức đăng ký doanh nghiệp vào tháng 3, Abliteration.ai đưa kỹ thuật này từ một hoạt động nguồn mở mang tính ngầm trong cộng đồng thành một dịch vụ thương mại, sẵn có để sử dụng. Bằng cách lưu trữ mô hình, Abliteration giảm bớt những trở ngại đối với những người mà nếu không sẽ phải tự tải xuống các mô hình đã được abliterate và bảo đảm tài nguyên điện toán cần thiết để vận hành chúng.
Khi sử dụng dịch vụ này, TechCrunch đã nhanh chóng tạo tài khoản và bắt đầu miễn phí truy vấn phiên bản GLM-5.3 đã được abliterate thông qua trình duyệt web. Chúng tôi yêu cầu mô hình viết một chương trình Python đánh cắp mật khẩu Chrome được lưu trữ, đồng thời yêu cầu một quy trình chi tiết để nuôi cấy một mầm bệnh nguy hiểm ở người tại nhà, và mô hình đã sẵn sàng thực hiện.
Đồng sáng lập Abliteration.ai, Devon, cho biết startup có một số thỏa thuận với các nhà cung cấp dịch vụ đám mây lớn và có khả năng chi trả hoàn toàn bằng doanh thu từ khách hàng. (Theo yêu cầu của Devon, chúng tôi không công bố họ của ông vì ông vẫn đang làm việc tại một công ty khác.) Abliteration.ai chưa huy động bất kỳ khoản vốn đầu tư mạo hiểm nào nhưng đang đàm phán để thực hiện việc này.
Các nhà phê bình cho rằng việc cung cấp các mô hình đã được abliterate trên quy mô lớn có thể dẫn đến những tác hại thực tế. Andrew Yoon, trưởng bộ phận nghiên cứu tại tổ chức phi lợi nhuận về an toàn AI CivAI, nói với TechCrunch rằng việc abliterate mô hình cho phép bạn “chỉnh sửa mô hình để nó trở thành một kẻ thái nhân cách”.
“Bạn có thể nhập đúng nghĩa bất cứ thứ gì vào đây, và nó sẽ thực hiện”, Yoon nói. “Khi mọi người nói về việc loại bỏ các hàng rào an toàn khỏi mô hình AI, đây chính là điều chúng ta đang nói đến… Tôi cho rằng trong tương lai gần, chúng ta sẽ bắt đầu chứng kiến những mô hình đã được chỉnh sửa, đã được abliterate, bị sử dụng để gây hại.”

Ảnh chụp màn hình. Nguồn ảnh: X.
Phần lớn các chuyên gia mà TechCrunch trao đổi cho rằng không thể ngăn chặn xu hướng này. Nhưng nếu việc loại bỏ các biện pháp bảo vệ khỏi các mô hình có trọng số mở không thể được ngăn chặn một cách thực tế, chính phủ vẫn có thể can thiệp ở những khâu khác. Trong một bài viết quan điểm gần đây, Yoon đề xuất chính phủ yêu cầu các nhà cung cấp vận hành các bộ phân loại để phát hiện và chặn các hoạt động gây hại liên quan đến mạng và vũ khí sinh học. Ông cũng cho rằng các công ty cho thuê quyền truy cập trực tiếp vào những GPU tiên tiến nên được yêu cầu xác minh danh tính khách hàng và “từ chối quyền truy cập khi có lý do để nghi ngờ việc sử dụng sai mục đích nguy hiểm”.
Abliteration.ai cung cấp cho khách hàng một lớp kiểm duyệt (moderation layer) để họ có thể bổ sung bất kỳ hàng rào an toàn nào mà mình mong muốn. Bản thân nền tảng cũng có một số hàng rào an toàn nhỏ - chẳng hạn, trong quá trình thử nghiệm, chúng tôi không thể khiến mô hình cung cấp hướng dẫn tự tử - và Devon cho biết ông đang làm việc để triển khai thêm các biện pháp nhằm ngăn chặn bạo lực.
Abliteration.ai cũng chưa tích hợp bất kỳ biện pháp KYC (Know Your Customer - xác minh khách hàng) nào ngoài việc lưu lại thông tin thẻ tín dụng mà khách hàng sử dụng để mua dịch vụ. Công ty cho biết vấn đề quyết định ai được quyền truy cập là một vấn đề khó mà công ty còn non trẻ này vẫn đang tìm cách giải quyết.
“Bạn không muốn trở thành người chịu trách nhiệm khi ai đó làm điều gì đó điên rồ… vậy bạn vạch ra ranh giới trách nhiệm của mình với tư cách một công ty ở đâu?”, Devon nói. “Chúng tôi vẫn đang trong quá trình xác định điều đó.”
Điều này đặt ra những câu hỏi mà ngành công nghiệp và các chính phủ sẽ phải đối mặt khi ngày càng có nhiều mô hình có năng lực cao được phát hành với trọng số có thể tải xuống: Nếu bất kỳ ai cũng có thể loại bỏ các biện pháp bảo vệ của một mô hình, việc khiến mô hình sau khi bị loại bỏ các biện pháp bảo vệ trở nên dễ tiếp cận hơn với mọi người sẽ khiến Internet an toàn hơn hay nguy hiểm hơn?
Nhà sáng lập Abliteration.ai và những người ủng hộ khác cho rằng dân chủ hóa quyền tiếp cận các mô hình tiên phong không kiểm duyệt là hình thức phòng thủ tốt nhất.
“Bức tranh lớn về các mô hình đã được abliterate là chúng có khả năng mô phỏng những kẻ xấu”, Devon nói. “Lợi thế là giờ đây những người phòng thủ có thể di chuyển nhanh nhất có thể. Họ có tất cả những công cụ cần thiết để có thể mô phỏng những kẻ xấu đó và sau đó phòng thủ trước những hành động xấu đó, và tôi nghĩ điều này sẽ thúc đẩy an ninh mạng, đây là một quan điểm khá phản trực giác.”
Devon cho biết mặc dù vẫn là một công ty non trẻ, khách hàng của Abliteration.ai bao gồm một số startup red teaming ở giai đoạn đầu có trụ sở tại Anh và châu Âu, những công ty giúp các ngân hàng, hãng hàng không và các doanh nghiệp khác liên quan đến cơ sở hạ tầng quan trọng tăng cường hoạt động an ninh mạng.
“Một trong những khách hàng lớn của chúng tôi thực hiện red team đối với các tác tử của ngân hàng, và hiện nay họ sẽ không thể sử dụng các mô hình ngay khi xuất xưởng để red team những tác tử đó”, Devon nói.

TechCrunch đã tạo một tài khoản miễn phí và thử nghiệm phiên bản GLM-5.3 đã được abliterate. Nguồn ảnh: TechCrunch/Abliteration.ai
Trong khi đó, ngành công nghiệp an ninh mạng vẫn đang tìm hiểu xem các mô hình đã được abliterate phù hợp với công việc phòng thủ ở mức độ nào, nếu thực sự phù hợp.
Một số công ty red teaming tác tử mà TechCrunch trao đổi đồng ý với Devon rằng những kẻ xấu đã tự abliterate các mô hình của chúng và sử dụng chúng để thực hiện các cuộc tấn công đối kháng, qua đó củng cố lập luận rằng lực lượng phòng thủ cũng cần có những công cụ tương tự. Tuy nhiên, họ khác nhau về mức độ tác động thực sự của các mô hình đã được abliterate đối với quá trình này.
Trong khi Devon khẳng định rằng việc abliterate mô hình là yếu tố thiết yếu để thực hiện red teaming tác tử một cách toàn diện, một số người cho biết họ không sử dụng chúng trong công việc hằng ngày, thay vào đó dựa vào sự thuận tiện của việc tinh chỉnh (fine-tuning) các mô hình có trọng số mở - vốn đã có tương đối ít hàng rào an toàn - để thực hiện kiểm thử.
Ahmed Aly, CEO của công ty red teaming tác tử Fabraix, cho biết công ty của ông dựa nhiều hơn vào việc tinh chỉnh các mô hình mở thay vì sử dụng những mô hình đã được abliterate, đồng thời nói thêm rằng quá trình abliteration loại bỏ một phần kiến thức và năng lực của mô hình.
“Nếu bạn thực sự đang cố gắng sử dụng nó để gây ra tác hại thực sự - tác hại trên không gian mạng, tác hại sinh học - thì nó sẽ không hiệu quả bằng”, Aly nói với TechCrunch.
Alessio Lomuscio, giám đốc công nghệ của Safe Intelligence, đồng ý rằng việc suy giảm năng lực là có thể xảy ra, nhưng vẫn tin rằng các mô hình đã được abliterate có thể khơi gợi một số hành vi hữu ích cho việc kiểm thử sức chịu đựng (stress-testing) của một hệ thống.
“Cho đến nay, các mô hình đã được abliterate không phải là một phần của quy trình”, David Slater, nhà sáng lập kiêm kiến trúc sư trưởng tại nền tảng an ninh mạng Armadin, nói với TechCrunch. “Khi chúng tôi xem xét các mô hình có trọng số mở cho đến thế hệ hoàn toàn mới nhất này, việc jailbreak chúng và khiến chúng thực hiện những gì chúng tôi muốn vốn không quá khó.”
Ông nói thêm rằng Armadin đang nghiên cứu abliteration, đồng thời tin rằng “việc thúc đẩy cộng đồng mở hiểu được năng lực của các mô hình là điều mang tính then chốt”.
“Điều này sẽ xảy ra sau những cánh cửa đóng kín. Nó sẽ xảy ra trong phạm vi riêng tư”, Slater nói tiếp. “Việc nó diễn ra công khai mang lại cho các nhà nghiên cứu những công cụ. Nó cho chúng tôi khả năng tìm ra giới hạn năng lực thực sự nằm ở đâu và hiểu được tác hại.”
