大数跨境

AI开始“抢”旧书:亚马逊被曝大量采购,扫描后连书一起销毁!

AI开始“抢”旧书:亚马逊被曝大量采购,扫描后连书一起销毁! KIMO跨境
2026-08-18
13
导读:!

亚马逊大规模采购纸质书:不是为了销售,而是为了AI训练

外媒 404 Media 最新调查显示,亚马逊正于美国大规模收购纸质书籍,并将其运往拉斯维加斯仓库进行批量扫描。为提高效率,部分书籍在扫描过程中被直接切除书脊,原书随之损毁。这一现象揭示了 AI 行业的新趋势:为获取“干净”的训练数据,几十年前的纸质书正成为稀缺资源。

千本图书追踪:最终抵达亚马逊仓库

调查发现,过去一年二手书商频繁收到异常订单:买家一次性购入数十至上百本书籍,品类杂乱且对价格不敏感。今年 7 月,某书商在 Biblio 平台收到一笔约 1000 本书的大额订单。

为确认买家身份,404 Media 与书商合作,在书中植入 Apple AirTag 进行物流追踪。结果显示,该书最终抵达美国拉斯维加斯亚马逊 LAS8 仓库。据悉,该仓库设有名为 VGT3 的团队,专门负责接收纸质书并切除装订部分以加速扫描,此过程将不可逆地破坏原书。

对此,亚马逊回应称通过商业渠道购书旨在“开发和改进产品及服务”,但未明确说明数据具体用于哪个 AI 模型,也未证实 VGT3 团队数据全数用于训练 Nova 模型。目前可确认的是,亚马逊确实在大规模采购并数字化处理纸质书,具体 AI 用途尚未完全公开。

AI 为何“抢”旧书?规避数据污染

互联网内容正面临被 AI 生成内容反向污染的危机。若新一代 AI 继续利用上一代 AI 生成的数据进行训练,可能导致“模型坍塌”,丧失真实人类表达与原始知识。因此,2022 年以前出版的纸质书因未受 AI 内容污染,成为高价值数据源。

此外,大量大学出版社教材、专业著作、绝版书及小众出版物从未完整数字化。这些书籍蕴含互联网缺失的独特数据,且内容经过作者系统整理,比零散抓取的网络数据更为“干净”,成为 AI 公司争相获取的目标。

书商眼中的异常“扫货”潮

早在 2024 年,图书卖家便察觉到异常:大量分散品类的书籍被集中采购,甚至包括低销量专业书。与传统机构采购不同,这些买家无明确目录且不计较价格,引发书商对背后买主身份的猜测。

由于二手平台不公开买家信息,真相一度成谜。直至此次 AirTag 追踪技术的应用,才证实其中一批大规模采购的书籍最终流入亚马逊仓库,印证了 AI 公司通过实体书获取训练数据的推测。

合法路径:从 Anthropic 到亚马逊

亚马逊并非首家此举的公司。此前法院文件披露,Anthropic 曾启动"Project Panama"项目,通过购买实体书进行破坏性扫描以获取 AI 训练数据。美国法院裁定,在特定条件下,合法购买实体书后进行一对一数字化并用于 AI 训练可构成“合理使用”。

然而,这并不意味着 AI 公司可随意扫描版权书籍。法院对通过盗版来源获取电子书的行为仍持否定态度。由此可见,“购买正版实体书再数字化”与“直接使用盗版电子资源”在法律性质上截然不同,实体书采购已成为 AI 公司获取合规数据的新路径。

数据争夺战升级:纸质书的新使命

互联网竞争焦点已从流量、算力转向高质量人类数据。当网络内容日益被 AI 生成物充斥,图书馆与旧书店中的纸质书因其未被算法篡改的特性而变得珍贵。AI 公司不再需要保留书籍实体,仅需切除书脊、扫描提取文字,纸质书本身反而成为“副产品”。

三十多年前,亚马逊靠卖书起家;如今,它又大规模买书,但逻辑已变:从“卖书给人”转向“买书取数”。当旧书转化为稀缺的 AI 训练数据,传统出版业、作者权益及二手书市场或将迎来深刻变革。

【声明】内容源于网络
0
0
KIMO跨境
各类跨境出海行业相关资讯
内容 624
粉丝 0
KIMO跨境 各类跨境出海行业相关资讯
总阅读35.6k
粉丝0
内容624