Việc đào tạo mô hình AI bằng sách có bản quyền có hợp pháp không? Một vấn đề đầy phức tạp
Hẳn bạn đã biết rằng các mô hình AI đứng sau ChatGPT, Gemini, Claude và các chatbot khác được đào tạo trên những cơ sở dữ liệu dường như vô tận gồm các tác phẩm đã xuất bản, chứa hàng trăm triệu cuốn sách, bài báo trực tuyến, tài liệu học thuật và về cơ bản là bất cứ thứ gì có thể tìm thấy trên internet. Hầu hết các tác giả đã xuất bản, dù không hề hay biết hay đưa ra sự đồng thuận, đều đã góp phần vào việc phát triển chính những công cụ AI đang đe dọa làm suy yếu sinh kế của họ. Điều đó nghe có vẻ bất hợp pháp, đúng không?

Nguồn ảnh: NanoStockk / Getty Images.
Hẳn bạn đã biết rằng các mô hình AI đứng sau ChatGPT, Gemini, Claude và các chatbot khác được đào tạo trên những cơ sở dữ liệu dường như vô tận gồm các tác phẩm đã xuất bản, chứa hàng trăm triệu cuốn sách, bài báo trực tuyến, tài liệu học thuật và về cơ bản là bất cứ thứ gì có thể tìm thấy trên internet. Hầu hết các tác giả đã xuất bản, dù không hề hay biết hay đưa ra sự đồng thuận, đều đã góp phần vào việc phát triển chính những công cụ AI đang đe dọa làm suy yếu sinh kế của họ. Điều đó nghe có vẻ bất hợp pháp, đúng không?
Thực tế lại không hề đơn giản như vậy.
"Tôi cho rằng một trong những vấn đề đối với toàn bộ lĩnh vực luật pháp cũng như mảng công nghệ này là có quá nhiều thứ đang diễn ra," Cathy Gellis, một luật sư chuyên về sở hữu trí tuệ, bản quyền và công nghệ, chia sẻ với TechCrunch. "Nó rất phức tạp và có vô số những cảm xúc trái chiều về những gì đang diễn ra, cả ủng hộ lẫn phản đối."
Tranh cãi từ những phán quyết đầu tiên
Năm ngoái, trong một trong những phán quyết đầu tiên thuộc loại hình này, Thẩm phán William Alsup đã ra lệnh cho Anthropic phải bồi thường một thỏa thuận bản quyền khổng lồ lên tới 1,5 tỷ USD (khoảng 37.500 tỷ VNĐ tính theo tỉ giá hiện tại) cho một nhóm các nhà văn có tác phẩm bị sử dụng để đào tạo các mô hình AI của công ty. Nhìn bề ngoài, đây có vẻ như là một chiến thắng về mặt đạo đức nghiêng về phía các tác giả, nhưng trên thực tế, Thẩm phán Alsup lại phán quyết rằng việc đào tạo AI của Anthropic là hợp pháp. Điều mà ông Alsup trừng phạt Anthropic là hành vi vi phạm bản quyền khi lấy những cuốn sách này từ các thư viện "bóng tối" (shadow libraries) bất hợp pháp trên mạng.
"Giống như bất kỳ độc giả nào khao khát trở thành nhà văn, các LLM (Mô hình ngôn ngữ lớn) của Anthropic được đào tạo dựa trên các tác phẩm không phải để vượt lên, sao chép hay thay thế chúng mà là để tạo ra một bước ngoặt và sáng tạo ra một thứ gì đó khác biệt," vị thẩm phán viết, so sánh cách một LLM tiêu thụ hàng nghìn tỷ từ ngữ với quá trình nghiên cứu văn học của một nhà văn.
Luật sư Gellis cho rằng phán quyết này mang lại nhiều lợi thế hơn cho các công ty AI. Khoản tiền phạt 1,5 tỷ USD có ý nghĩa gì đối với một công ty dự kiến đạt mức doanh thu hàng năm khoảng 200 tỷ USD (khoảng 5.000.000 tỷ VNĐ tính theo tỉ giá hiện tại) vào năm 2028?
"Tôi nghĩ nhìn chung đó là tin vui cho việc đào tạo AI khi ông ấy xem xét những gì đang diễn ra và thực sự coi nó tương tự như việc đọc một tác phẩm có bản quyền thay vì sao chép một tác phẩm có bản quyền," Gellis nói. "Luật bản quyền xoay quanh việc sao chép, nhưng nó không cấm việc sử dụng tác phẩm, trải nghiệm tác phẩm, tiêu thụ tác phẩm hay đọc tác phẩm."
Luật bản quyền của Mỹ đã không được cập nhật kể từ năm 1976, điều đó có nghĩa là các thẩm phán phải tìm cách diễn giải các hướng dẫn từ 50 năm trước khi đối mặt với những câu hỏi pháp lý có khả năng định hình tương lai của ngành công nghiệp AI.
"Mọi người hiện đang rất lo lắng vì luật pháp đang được áp dụng một cách khá lộn xộn, và đó là vì câu hỏi này," Jason Henderson, Luật sư Cấp cao và Nhà sáng lập Bộ phận Hành nghề Sở hữu Trí tuệ & Truyền thông tại JWL International, nói với TechCrunch. "Họ biết rằng mô hình AI đã được đào tạo trên rất nhiều dữ liệu, nhưng luật pháp thực sự vẫn chưa theo kịp câu hỏi đó."
Ranh giới của khái niệm "Sử dụng hợp lý" (Fair Use)
Những câu hỏi này thường phụ thuộc vào luật "sử dụng hợp lý" cụ thể là liệu việc sử dụng một tác phẩm có bản quyền có đủ tính "chuyển đổi" (transformative) để được coi là hợp pháp hay không.
Sử dụng hợp lý là một ngoại lệ của luật bản quyền, cho phép sử dụng các tài liệu có bản quyền mà không cần sự cho phép rõ ràng, bảo vệ khả năng bình luận và phát triển dựa trên các tác phẩm có bản quyền thông qua phê bình, nhại lại, giáo dục và các phương tiện khác. Các thẩm phán sẽ xem xét các yếu tố cụ thể khi quyết định xem một thứ gì đó có phải là sử dụng hợp lý hay không, bao gồm mục đích và bản chất của tác phẩm, khối lượng được sử dụng, cũng như tác động của nó đối với thị trường.
"Bản quyền luôn hướng tới việc bảo vệ và phát triển thị trường," Henderson lưu ý. "Lập luận của các tòa án (trong các vụ kiện AI) đang khá đa chiều. Xu hướng chung dẫn đến chiến thắng là nếu những gì bạn đang làm là đào tạo trên tài sản của người khác với mục đích cạnh tranh trực tiếp, thì các tòa án sẽ không chấp thuận... Còn nếu những gì bạn làm không mang tính cạnh tranh, thì tòa án đang có xu hướng tìm cách để cho phép điều đó."
Henderson đang đề cập đến một vụ án trong đó công ty truyền thông và công nghệ Thomson Reuters đã kiện công ty nghiên cứu Ross Intelligence vì sao chép nội dung của họ nhằm xây dựng một nền tảng pháp lý dựa trên AI cạnh tranh trực tiếp.
"Việc sử dụng của Ross không mang tính chuyển đổi vì nó không có 'mục đích xa hơn hoặc tính chất khác biệt' so với của Thomson Reuters," Thẩm phán Stephanos Bibas đã viết vào năm ngoái.
Trong vụ án đó, Thẩm phán Bibas quyết định rằng việc đào tạo trên nội dung của Reuters để tạo ra một nền tảng mới cạnh tranh trực tiếp với chính nó không phải là sử dụng hợp lý. Mặc dù các tác giả có thể lập luận rằng các chatbot đang cạnh tranh với họ bằng cách sử dụng các tác phẩm của họ để tạo ra những cuốn sách tổng hợp mới, nhưng lập luận đó vẫn chưa giành được thắng lợi trước tòa.
Mối quan hệ phức tạp giữa AI và Bản quyền
Khi nói đến mối quan hệ giữa AI và bản quyền, Gellis thấy hữu ích khi thu hẹp lại những gì chúng ta thực sự đang thảo luận – cách chúng ta nghĩ về bản quyền trong bối cảnh đào tạo AI hoàn toàn khác với cách chúng ta nghĩ về việc đăng ký bản quyền cho nội dung do AI tạo ra.
Trong một vụ án mang tên Thaler kiện Perlmutter, tòa án đã phán quyết rằng nếu một tác phẩm do AI tạo ra 100%, nó sẽ không thể được cấp bản quyền. Điều này mở ra một loạt vấn đề nan giải mới – làm thế nào chúng ta có thể chứng minh một cách chắc chắn liệu một tác phẩm có được tạo ra bằng AI hay không, và nếu có, làm thế nào chúng ta biết được bao nhiêu phần trăm trong số đó được tạo ra hoặc có sự hỗ trợ của AI?
"Nếu bạn viết tiểu thuyết của mình trên (Microsoft) Word và chạy tính năng kiểm tra lỗi chính tả, chúng ta cảm thấy khá thoải mái với ý nghĩ rằng Word không sở hữu cuốn tiểu thuyết của bạn," Gellis nói. "(AI) đang buộc chúng ta phải xem xét lại hàng loạt quyết định mà chúng ta đã từng phớt lờ trong một thời gian dài."
Hầu hết các công ty AI vẫn đang vướng vào các vụ kiện tụng chưa ngã ngũ liên quan đến những vấn đề này, đồng nghĩa với việc chúng ta sẽ không sớm có được giải pháp dứt điểm.
"Những gì bạn đang thấy là những phát súng mở màn ban đầu đang tạo ra ảnh hưởng, và bản thân sức ảnh hưởng đó có thể bị đảo ngược nếu các tòa án khác đưa ra những phán quyết khác, và sẽ cần đến những giai đoạn kiện tụng sau này để tìm ra phe nào sẽ chiếm ưu thế," Gellis chia sẻ. "Nhưng trong lúc chờ đợi, tất cả những phán quyết này đang định hình mọi thứ đang diễn ra. Sẽ thật ngu ngốc nếu các công ty AI phớt lờ chúng."
