Bất chấp làn sóng tẩy chay, Anthropic chính thức tung "vũ khí" đánh dấu watermark trên Claude
Hôm thứ Sáu, Anthropic đã xuất bản một bài đăng trên blog nhằm giải đáp một số câu hỏi cơ bản về cách họ sẽ chèn watermark (dấu hiệu nhận biết/hình mờ) vào văn bản do chatbot Claude tạo ra. Chẳng hạn như: Quá trình chèn watermark thực chất sẽ hoạt động ra sao? Liệu nó có thể bị che giấu thông qua việc chỉnh sửa? Và điều này ảnh hưởng như thế nào đến mã code?

Nguồn ảnh: atakan / Getty Images.
Cộng đồng người dùng Claude đã nổ ra tranh luận về động thái này kể từ khi công ty tiết lộ vào đầu tuần rằng họ sẽ thực hiện việc chèn watermark nhằm tuân thủ Bộ quy tắc Minh bạch thuộc Đạo luật AI của Liên minh Châu Âu (EU AI Act). Đạo luật này yêu cầu các công ty AI phải sử dụng các hệ thống cho phép nhận diện nội dung do AI tạo ra.
Ví dụ, trên Reddit, một người dùng đã mô tả đây là một âm mưu chống lại những người sử dụng Claude vô tội, trong khi một người khác lại khẳng định: "Lý do duy nhất khiến bạn không muốn có tính năng này là để nói dối người khác." Và theo báo cáo từ Business Insider, "hàng chục" người dùng trên nền tảng X tuyên bố đã hủy đăng ký gói Claude của họ vì quyết định này.
Bài đăng mới của Anthropic bắt đầu bằng một cái nhìn tổng quan về khái niệm watermark, giải thích rằng khi đưa ra các "lựa chọn ít rủi ro" như việc chọn giữa từ "u ám" (overcast) và "xám xịt" (grey) để miêu tả thời tiết - Claude có thể tạo ra một mẫu hình trong các câu trả lời "không thể bị phát hiện bởi người đọc, nhưng lại có thể bị nhận diện bởi bất kỳ ai nắm giữ khóa giải mã của nó."
"Việc chèn watermark không hề ảnh hưởng đến chất lượng đầu ra của Claude," công ty khẳng định. "Đối với người đọc, một câu trả lời có watermark hoàn toàn không thể phân biệt được với một câu trả lời không có watermark."
Cụ thể hơn, Anthropic cho biết họ sẽ sử dụng phương pháp SynthID - Text mà đội ngũ Google DeepMind đã phác thảo vào năm 2024, và dự kiến sẽ phát hành một API nhận diện watermark. Hãng cũng lưu ý rằng việc đánh dấu watermark hoàn toàn khác biệt so với các phương pháp phát hiện AI do các công ty như Pangram cung cấp - những hệ thống thường tìm kiếm các "dấu hiệu nhận biết" trong lối hành văn (chẳng hạn như cấu trúc "đây không phải là [X], mà là [Y]") để vạch trần việc sử dụng AI: "Việc nắm bắt những mẫu hình này về bản chất là hoàn toàn khác so với việc kiểm tra một watermark."
Liệu ai đó có thể viết lại văn bản để che giấu watermark hay không? Anthropic thừa nhận điều đó là khả thi, nhưng "việc chỉnh sửa nhẹ nhàng có lẽ sẽ không xóa bỏ hoàn toàn được watermark," trong khi "một bản viết lại hoàn toàn, nơi từng câu chữ đều bị thay thế, thì có thể làm được điều đó."
"Tất nhiên, trong trường hợp sau, chúng ta có thể phải bàn cãi xem liệu văn bản đó có còn được coi là do AI tạo ra hay không," công ty nhận định.
Về việc liệu watermark có bị phát hiện trong các đoạn văn bản chỉ được Claude hiệu đính hoặc chỉnh sửa hay không, Anthropic cho biết điều đó sẽ phụ thuộc vào "độ dài của văn bản và mức độ can thiệp chỉnh sửa của Claude." Nếu văn bản chỉ được chỉnh sửa nhẹ, "gần như toàn bộ từ ngữ" vẫn do tác giả con người viết ra và "sẽ có rất ít (hoặc không có) không gian để watermark bám vào."
Trong khi đó, các đoạn mã code sẽ chứa ít watermark hơn so với văn bản thông thường, bởi lẽ mô hình cần tạo ra những đoạn code có thể hoạt động được và sẽ không có quyền tự do lựa chọn giữa nhiều phương án có giá trị tương đương nhau.
"Mặc dù vậy, ở những khía cạnh có sự lựa chọn ngẫu nhiên giữa các từ hoặc thuật ngữ cụ thể bên trong đoạn code, watermark vẫn có thể được sử dụng, chẳng hạn như trong các phần chú thích của code," Anthropic giải thích. "Nhưng về cơ bản, nó sẽ có tác động không đáng kể đến đoạn code thực tế được tạo ra."
Anthropic cũng khẳng định Claude sẽ không phải là chatbot AI duy nhất tạo ra văn bản có chứa watermark, vì "các nhà phát triển mô hình lớn khác cũng đã ký kết cùng một Bộ quy tắc Thực hành và sẽ sớm triển khai các hệ thống watermark của riêng họ."
