Ba nhà xuất bản quốc tế lớn gồm Hachette Book Group, Cengage Learning và Elsevier, cùng tác giả Scott Turow, đã đệ đơn kiện Google lên tòa án liên bang tại New York, cáo buộc công ty này sử dụng trái phép hàng triệu cuốn sách có bản quyền để huấn luyện mô hình AI Gemini. Theo The Guardian, vụ việc được mô tả là "một trong những vụ vi phạm bản quyền tài liệu có quy mô lớn nhất trong lịch sử".
Cáo buộc vi phạm bản quyền quy mô lớn
Các nhà xuất bản lập luận rằng Google đã lạm dụng sách từ các dịch vụ như Google Books, Google Play Books và Google Scholar. Các dịch vụ này chỉ cho phép hiển thị đoạn trích hoặc đề xuất sách điện tử, không cho phép sao chép toàn bộ để huấn luyện AI thương mại. Đơn kiện nêu rõ: "Vì quá khao khát duy trì vị thế thống trị trực tuyến, Google đã từ bỏ phương châm ban đầu 'Không làm điều ác' và tiến hành một trong những vụ vi phạm bản quyền tài liệu quy mô lớn nhất trong lịch sử".
Theo nội dung đơn kiện, Google đã sao chép sách để huấn luyện Gemini mà không xin phép hay trả phí, bất chấp việc nội bộ tập đoàn hiểu rõ rủi ro pháp lý. Hồ sơ vụ kiện cho biết Google từng ghi nhận nội bộ rằng họ có thể đối mặt với "khoản tiền phạt tiềm tàng từ hàng chục đến hàng trăm tỷ USD" do sử dụng tài liệu từ Google Play Books.
Tác động đến ngành xuất bản và tác giả
Các nhà xuất bản cho rằng hành động của Google gây tổn hại cho tác giả và toàn ngành, vì nội dung do AI tạo ra có thể làm giảm doanh số bán sách. Đơn kiện dẫn ví dụ Gemini có thể tạo ra "một cuốn tiểu thuyết trinh thám dài 100 trang lấy bối cảnh tại một thị trấn ven biển yên bình đầy rẫy bí ẩn" chỉ trong 20 phút với chi phí 39 xu, thay thế cho tác phẩm gốc có bản quyền. "Không một nhà xuất bản hay tác giả nào có thể cạnh tranh được với điều đó", đơn kiện nhấn mạnh.
Vụ kiện liệt kê một số tác phẩm bị sử dụng trái phép như The Fifth Season của N.K. Jemisin và Who Could That Be at This Hour? của Lemony Snicket. Các nguyên đơn yêu cầu tòa án ra phán quyết tuyên bố hành vi của Google vi phạm luật bản quyền, ban hành lệnh cấm xâm phạm trong tương lai, bồi thường thiệt hại ở mức tối đa và buộc tiêu hủy các bản sao vi phạm.
Bối cảnh pháp lý phức tạp
Vụ kiện này làm gia tăng các tranh chấp pháp lý về AI tạo sinh và bản quyền. Nhiều tác giả và nhà xuất bản đã kiện Google, OpenAI, Anthropic và Meta vì sử dụng trái phép tác phẩm để huấn luyện AI. Tháng 6 năm ngoái, thẩm phán Mỹ ra phán quyết có lợi cho Meta, cho rằng việc sử dụng tác phẩm có bản quyền để đào tạo AI là "sử dụng hợp lý". Trong khi đó, Anthropic đã đạt thỏa thuận dàn xếp chi trả 1,5 tỷ USD cho vụ kiện liên quan đến chatbot Claude. Năm nay, hàng nghìn tác giả như Kazuo Ishiguro, Philippa Gregory và Richard Osman đã phát hành một cuốn sách trắng phản đối việc AI sử dụng tác phẩm của họ.
Luật sư Kirk Sigmon từ KellDann Law nhận định: "Trong vụ kiện này, lập luận về 'sử dụng hợp lý' mà Gemini đưa ra có thể trở nên vô nghĩa do họ bị cáo buộc thu thập sách bất hợp pháp. Đây là vấn đề thú vị với nhiều khía cạnh phức tạp, một phần lớn là rất khó chứng minh chính xác tài liệu nào có trong tập dữ liệu huấn luyện AI".
Thách thức trong chứng minh vi phạm
Oli Huggins, CEO của ExpertEdge kiêm Phó chủ tịch Packt Publishing, cho biết: "Một khi thông tin đã được đưa vào quy trình huấn luyện, rất khó chứng minh liệu đầu ra của AI có vi phạm bản quyền hay không. Giống như quả trứng đã nướng thành bánh, việc nhận diện đóng góp của nó rất khó". Michael Goodyear, phó giáo sư tại Trường luật New York, bổ sung: "Nếu người dùng chủ động yêu cầu khiến AI vi phạm, thì người dùng có thể phải chịu trách nhiệm thay vì hệ thống AI. Đây vẫn là vấn đề bỏ ngỏ mà tòa án Mỹ chưa giải quyết thấu đáo".



