Sách in cũ thành 'mỏ vàng' dữ liệu huấn luyện AI
Sách in cũ trở thành 'mỏ vàng' dữ liệu cho AI

Cuộc điều tra của 404Media tiết lộ các công ty AI đang chuyển hướng sang thu mua số lượng lớn sách in cũ để phục vụ huấn luyện mô hình, thay vì phụ thuộc chủ yếu vào dữ liệu internet vốn ngày càng nhiều nội dung do AI tạo ra. Những cuốn sách xuất bản trước năm 2022 được đánh giá là nguồn dữ liệu chất lượng cao, do con người biên soạn, biên tập và kiểm chứng, nhờ đó giúp giảm nguy cơ mô hình AI tiếp tục học từ chính sản phẩm của mình.

Vì sao sách in cũ được xem là nguồn dữ liệu sạch

Sách xuất bản trước thời kỳ bùng nổ AI tạo sinh gần như không chứa nội dung do AI sinh ra. Điều này rất quan trọng trong bối cảnh internet đang bị “ô nhiễm” bởi hàng loạt văn bản, hình ảnh do AI tạo ra – hiện tượng thường gọi là “AI slop”. Nếu mô hình AI được huấn luyện trên chính dữ liệu AI tạo ra, chất lượng đầu ra có thể suy giảm nghiêm trọng do dữ liệu lặp lại và thiếu tính gốc.

Theo 404Media, sách in cũ trở thành “mỏ vàng” dữ liệu bởi chúng đại diện cho văn bản do con người thực sự viết, đã qua quy trình biên tập và xuất bản chặt chẽ. Các thư viện sách in, đặc biệt là những đầu sách xuất bản trước năm 2022, đang trở thành tài nguyên chiến lược cho cuộc đua phát triển mô hình ngôn ngữ thế hệ mới.

Banner rộng Pickt — ứng dụng danh sách mua sắm cộng tác cho Telegram

ISBNdb và thử nghiệm gây tranh cãi

Một trong những đơn vị được 404Media nhắc đến là ISBNdb, công ty vận hành cơ sở dữ liệu sách. Trước khi thông tin bị gỡ bỏ, ISBNdb từng quảng bá dịch vụ tìm nguồn sách in dành riêng cho các doanh nghiệp AI, với khả năng cung cấp từ hàng nghìn đến hàng triệu đầu sách phục vụ quá trình số hóa dữ liệu. Công ty cũng nhấn mạnh các thỏa thuận bảo mật, đồng thời thừa nhận việc một doanh nghiệp AI mua và xử lý hàng triệu cuốn sách có thể tạo ra phản ứng tiêu cực từ dư luận.

Sau khi bài điều tra được đăng tải, ISBNdb đã xóa trang giới thiệu dịch vụ này. Công ty giải thích đây chỉ là một thử nghiệm nhằm đánh giá nhu cầu thị trường và khẳng định không còn theo đuổi mô hình kinh doanh đó. Tuy nhiên, động thái này cho thấy các công ty AI đang tìm kiếm những nguồn dữ liệu thay thế ngoài internet ngày càng tích cực.

Người bán sách cũ nhận đơn hàng số lượng lớn

Không chỉ ISBNdb, nhiều người bán sách hiếm và sách đã ngừng phát hành bất ngờ nhận được các đơn hàng với số lượng lớn kể từ đầu năm. 404Media ghi nhận lượng đơn hàng mua số lượng lớn tăng mạnh trong những tháng gần đây, với các đầu sách thuộc nhiều lĩnh vực khác nhau. Một số người bán cho biết doanh số tăng đáng kể, nhưng đồng thời bày tỏ lo ngại về mục đích cuối cùng của các giao dịch này, bởi nhiều cuốn sách sau khi được mua sẽ bị cắt gáy, quét thành dữ liệu số rồi loại bỏ bản in giấy.

Việc tiêu hủy sách in sau khi số hóa đặt ra câu hỏi về giá trị văn hóa và lâu dài của nguồn tài nguyên tri thức này. Dù sách in cũ mang lại dữ liệu sạch cho AI, mục đích thương mại của các giao dịch hàng triệu cuốn sách có thể dẫn đến tổn thất không thể phục hồi đối với các bản in quý hiếm.

Banner sau bài viết Pickt — ứng dụng danh sách mua sắm cộng tác với hình minh họa gia đình

Bài toán dữ liệu gốc cho thế hệ AI mới

Xu hướng trên phản ánh thách thức ngày càng lớn của ngành AI: khi internet chứa nhiều nội dung do chính AI tạo ra, việc tìm kiếm nguồn dữ liệu gốc, chất lượng và đáng tin cậy trở nên khó khăn hơn. Các công ty AI phải cân nhắc giữa chi phí thu thập dữ liệu và chất lượng mô hình, đồng thời đối mặt với rủi ro pháp lý và dư luận khi sử dụng sách có bản quyền.

Cuộc săn lùng sách in cũ cho thấy một thực tế: dữ liệu do con người tạo ra vẫn là tài sản quý nhất trong kỷ nguyên trí tuệ nhân tạo. Khi nguồn dữ liệu internet bị bão hòa bởi nội dung AI, những thư viện sách giấy – nơi lưu giữ tri thức được hiệu đính cẩn thận – trở thành mặt trận mới trong cuộc đua phát triển các mô hình ngôn ngữ lớn.