Nước cờ mới của chính quyền Trump: Bênh vực việc OpenAI dùng dữ liệu có bản quyền để huấn luyện AI.
Trong vụ kiện do tờ The New York Times đệ trình nhằm vào OpenAI, chính quyền Tổng thống Trump đã đóng góp một bản tóm tắt pháp lý (brief) dài 20 trang nhằm bảo vệ việc "cha đẻ" của ChatGPT sử dụng tài liệu có bản quyền chưa được cấp phép để đào tạo các mô hình ngôn ngữ lớn (LLM).

Nguồn ảnh: Samuel Boivin/NurPhoto / Getty Images.
"Hợp chủng quốc Hoa Kỳ có lợi ích to lớn trong việc tiếp tục phát triển một ngành công nghiệp trí tuệ nhân tạo vững mạnh và đầy sức cạnh tranh, nhằm thiết lập các tiêu chuẩn cho hoạt động và quy trình sử dụng AI trên toàn cầu... Do đó, việc nước Mỹ 'duy trì vị thế lãnh đạo toàn cầu về trí tuệ nhân tạo' là vô cùng quan trọng," bản tóm tắt nêu rõ, đồng thời trích dẫn một sắc lệnh hành pháp do Tổng thống Donald Trump ký kết vào năm ngoái.
Các LLM đứng sau những chatbot như ChatGPT, Claude và Gemini được đào tạo dựa trên các cơ sở dữ liệu khổng lồ gồm các tác phẩm đã xuất bản, bao gồm sách, bài báo có bản quyền và nhiều phương tiện truyền thông khác mà các công ty AI đã đưa vào hệ thống mà chưa có sự cho phép. Nhiều nhà xuất bản, trong đó có The New York Times ở vụ kiện này, đã nỗ lực lập luận rằng hành động đào tạo mô hình AI trên dữ liệu có bản quyền của các công ty như OpenAI là vi phạm pháp luật.
Câu hỏi đặt ra - liệu có thể sử dụng tài liệu có bản quyền để đào tạo AI hay không? - không hề có đáp án rạch ròi đen trắng, dẫn đến hàng loạt cuộc tranh luận pháp lý kéo dài xung quanh chủ đề này. Các cuộc thảo luận thường xoay quanh nguyên tắc "sử dụng hợp lý" (fair use), một ngoại lệ trong luật bản quyền cho phép sử dụng tác phẩm của người khác mà không cần xin phép trong một số tình huống cụ thể. Trong trường hợp này, cuộc tranh luận về "sử dụng hợp lý" tập trung vào việc liệu việc các công ty AI sử dụng tác phẩm có bản quyền có đủ tính "chuyển đổi" (transformative) để thẩm phán đưa ra phán quyết hợp pháp hay không.
Bản tóm tắt nhận định: "Việc kìm hãm sự phát triển của LLM do những hiểu lầm về học thuyết sử dụng hợp lý sẽ cản trở những tiến bộ khoa học và sáng tạo, đồng thời kìm hãm sự thịnh vượng và tính linh hoạt của nền kinh tế Mỹ."
Cho đến nay, các vụ án liên quan đến việc đào tạo AI và vi phạm bản quyền phần lớn đều mang lại kết quả có lợi cho các công ty AI. Năm ngoái, Thẩm phán William Alsup đã ra lệnh cho Anthropic phải trả khoản tiền bồi thường bản quyền trị giá 1,5 tỷ USD (Khoảng 37.500 tỷ VNĐ) cho một nhóm nhà văn có tác phẩm bị sử dụng để đào tạo mô hình AI của công ty; tuy nhiên, Anthropic không bị phạt vì hành vi đào tạo AI. Thay vào đó, công ty này bị phạt vì đã sử dụng các thư viện "bóng tối" (shadow libraries) bất hợp pháp nhằm thu thập lậu các cuốn sách được dùng trong quá trình đào tạo.
"Giống như bất kỳ độc giả nào khao khát trở thành nhà văn, các LLM của Anthropic được đào tạo trên các tác phẩm không phải để chạy đua, sao chép hay thay thế chúng, mà là để rẽ sang một hướng đi mới và tạo ra những điều khác biệt," Thẩm phán Alsup viết, so sánh quá trình đào tạo LLM với việc con người đọc sách.
Bản tóm tắt pháp lý mới này của chính quyền Trump không phải là một phán quyết, bởi vụ án đang được xét xử tại Tòa án Quận Liên bang khu vực phía Nam New York, và những người soạn thảo bản tóm tắt không có thẩm quyền tài phán. Tuy nhiên, sự can thiệp này từ chính quyền Trump vẫn có thể mang lại sức nặng nhất định cho kết quả cuối cùng.
