Back to Explore
Khi tri thức nhân loại bị nghiền nát: Bí ẩn đằng sau việc hủy hoại sách hiếm để huấn luyện AI

Khi tri thức nhân loại bị nghiền nát: Bí ẩn đằng sau việc hủy hoại sách hiếm để huấn luyện AI

Một làn sóng lo ngại đang bao trùm giới buôn sách cũ khi các đầu sách hiếm có dấu hiệu bị thu mua và hủy hoại để làm dữ liệu huấn luyện AI. Bài viết phân tích thực trạng 'destructive scanning' và những hệ lụy đối với di sản văn hóa trong kỷ nguyên trí tuệ nhân tạo.

Website
Upvote this postSign in to upvote this article.

Bài viết được dịch và tổng hợp từ tin tức gốc. Bạn có thể đọc bài viết gốc bằng tiếng Anh tại đây.

Điểm tin nhanh:

  • Các nhà buôn sách cũ tại Úc nghi ngờ sách hiếm đang bị thu mua số lượng lớn để phục vụ việc quét dữ liệu huấn luyện cho các mô hình AI.
  • Quy trình 'destructive scanning' (cắt gáy, quét trang, nghiền nát phần còn lại) đã được xác nhận là hợp pháp trong một số phán quyết tòa án tại Mỹ.
  • Sự thiếu minh bạch trong chuỗi cung ứng dữ liệu khiến các nhà bán lẻ không thể kiểm soát mục đích cuối cùng của những đơn hàng bí ẩn từ các đơn vị như Zoom Books.

Trong kỷ nguyên mà dữ liệu sạch trở thành loại tài nguyên quý giá hơn cả vàng ròng, các công ty AI đang ráo riết săn lùng những nguồn tài liệu in ấn trước thời đại internet. Những cuốn sách cũ, vốn chứa đựng ngôn ngữ tự nhiên thuần túy không bị nhiễu bởi rác kỹ thuật số, đang trở thành mục tiêu hàng đầu. Tuy nhiên, đằng sau cơn khát dữ liệu này là một thực trạng đáng báo động: những cuốn sách hiếm, đôi khi là bản sao duy nhất còn tồn tại, đang bị cắt gáy và nghiền nát để phục vụ cho việc huấn luyện các mô hình ngôn ngữ lớn (LLM).

Thực trạng Destructive Scanning và sự im lặng của các ông lớn

Khái niệm 'destructive scanning' (quét hủy hoại) lần đầu được đưa ra ánh sáng thông qua các hồ sơ tòa án trong vụ kiện bản quyền chống lại Anthropic. Thay vì giữ nguyên giá trị của cuốn sách, quy trình này bao gồm việc cắt bỏ gáy sách, quét từng trang tài liệu bằng máy quét tốc độ cao, và cuối cùng là nghiền nát (pulp) phần còn lại để tái chế. Mặc dù các công ty AI thường khẳng định họ tuân thủ các tiêu chuẩn đạo đức, nhưng sự thiếu minh bạch trong chuỗi cung ứng dữ liệu vẫn là một dấu hỏi lớn.

Booksellers fear their rarest books are being pulped to feed AI. The trail leads to a ‘recycler’.

Bảng so sánh quy trình xử lý tài liệu truyền thống và AI

Đặc điểm Lưu trữ truyền thống Quy trình AI (Destructive)
Mục đích Bảo tồn tri thức Trích xuất dữ liệu huấn luyện
Tình trạng sách Giữ nguyên vẹn Cắt gáy, hủy hoại
Khả năng tái sử dụng Cao (đọc, sưu tầm) Không (đã nghiền nát)
Tính minh bạch Cao (nguồn gốc rõ ràng) Thấp (thông qua trung gian)

Khi các nhà buôn sách trở thành nạn nhân bất đắc dĩ

Tại Úc, nhiều nhà buôn sách cũ đã nhận thấy những làn sóng đơn hàng bất thường thông qua các nền tảng như Abebooks và Biblio. Những đơn hàng này thường không quan tâm đến giá cả và có danh mục sản phẩm cực kỳ ngẫu nhiên, từ các tài liệu kỹ thuật cũ đến sách thơ không bán được trong hàng thập kỷ. Các đơn vị như Zoom Books bị đưa vào tầm ngắm khi họ liên tục thực hiện các giao dịch với số lượng lớn mà không giải thích rõ mục đích.

Lưu ý: Sự thiếu minh bạch trong các điều khoản bảo mật của các đơn vị trung gian khiến các nhà bán lẻ không có bằng chứng pháp lý để ngăn chặn việc sách của họ bị phá hủy. Đây là một bài học đắt giá về minh bạch dữ liệu trong kỷ nguyên AI.

Góc nhìn từ chuyên gia: Đạo đức hay lợi nhuận?

Việc phá hủy sách để lấy dữ liệu không phải là hiện tượng mới, nhưng quy mô hiện tại đã vượt xa các mục đích thương mại thông thường. Đối với những lập trình viên đang xây dựng các hệ thống AI Agent, việc hiểu rõ nguồn gốc dữ liệu là vô cùng quan trọng. Nếu dữ liệu được thu thập bằng cách hủy hoại di sản, liệu kết quả đầu ra của mô hình có thực sự mang tính đạo đức?

Ana-Maria Stanciuc

Đánh giá & Lời khuyên Thực tiễn

Từ góc độ của một kỹ sư cấp cao, việc phụ thuộc vào dữ liệu từ các nguồn không minh bạch tiềm ẩn rủi ro về mặt pháp lý và danh tiếng.

  • Ưu điểm: Dữ liệu từ sách cũ giúp cải thiện chất lượng ngôn ngữ của LLM, giảm thiểu rào cản về ngữ cảnh và văn phong.
  • Nhược điểm: Rủi ro cao về vi phạm bản quyền và hủy hoại di sản văn hóa. Các mô hình huấn luyện trên dữ liệu này có thể gặp vấn đề về tính chính xác nếu nguồn tài liệu bị cắt xén không hoàn chỉnh.
  • Lời khuyên: Các doanh nghiệp công nghệ nên ưu tiên xây dựng AI Code Reviewer hoặc các hệ thống huấn luyện dựa trên dữ liệu có bản quyền rõ ràng. Hãy luôn kiểm tra kỹ nguồn gốc dữ liệu trước khi đưa vào pipeline huấn luyện để tránh các rắc rối về sau, tương tự như cách chúng ta quản trị khủng hoảng khi sự minh bạch bị bỏ ngỏ.

Câu hỏi thường gặp (FAQ)

Destructive scanning có vi phạm pháp luật không?

Hiện tại, tại một số khu vực như Mỹ, việc này đã được tòa án phán quyết là 'transformative use' (sử dụng mang tính chuyển đổi), cho phép thực hiện trong khuôn khổ huấn luyện AI.

Tại sao các công ty AI không quét sách mà không cần phá hủy?

Việc quét sách mà không cắt gáy thường tốn kém hơn, chậm hơn và chất lượng hình ảnh không cao bằng việc sử dụng máy quét công nghiệp tốc độ cao yêu cầu sách phải được tháo rời.

Làm thế nào để nhà bán lẻ bảo vệ sách của mình?

Cách duy nhất hiện nay là sàng lọc người mua và đặt ra các điều khoản trong hợp đồng bán hàng cấm việc sử dụng tài liệu cho mục đích huấn luyện AI, dù việc thực thi rất khó khăn.

Kết luận

Sự phát triển của AI không nên là cái cớ để xóa sổ những giá trị văn hóa vật thể. Là những người làm công nghệ, chúng ta cần thúc đẩy sự minh bạch trong chuỗi cung ứng dữ liệu. Hãy cùng thảo luận về vấn đề này và đừng quên theo dõi hi_dev để cập nhật những xu hướng công nghệ mới nhất một cách có trách nhiệm.

Discussion (0)

You need to log in to post comments. Log In

No comments yet. Start the discussion!