随着 AI 生成内容泛滥,人工创作的“干净语料”日益稀缺,AI 巨头纷纷将目光投向纸质书籍。
独立媒体 404 MediaX 近日报道指出,人工智能公司正批量采购 2022 年前出版的珍稀书籍。为获取未被 AI“污染”的纯净数据,这些书籍被液压切割机切除书脊后进行扫描,随后为防止数据回流市场而被粉碎销毁。据悉,Anthropic 已销毁数百万册实体书,甚至包含绝版古籍。
该项行动被称为“巴拿马计划”,美国联邦法院裁定其合法,认定“合法购买纸质书并进行破坏性扫描”属于合理使用范畴。
报道引发舆论热议。X 平台账号 Hedgie 转述此事时获马斯克回应,后者表示已要求 SpaceX AI 团队保存图书馆珍贵书籍,采用无损扫描方式以避免破坏书脊。Hedgie 对此表示认可,并呼吁业内其他公司以 SpaceX AI 为标准。
书籍成 AI 训练核心语料,产业链加速重构
无论数据采集方式如何争议,书籍已成为 AI 训练的重要来源。ISBNdb 已从图书数据库服务商转型为 AI 企业的数据供应商;《华盛顿邮报》发现,Anthropic 亦与旧书交易平台 Better World Books 达成合作。
版权纠纷频发,出版业迎数字化新机遇
海外出版传媒集团与 AI 企业的法律博弈日趋激烈:
- 7 月 22 日,新闻集团(News Corp)向加州奥克兰联邦法院提起反诉,指控 Brave Software 未经授权抓取并转售旗下媒体文章用于 AI 训练。
- 7 月 14 日,多家出版商联合起诉谷歌,指控其非法使用数百万本受版权保护书籍构建 Gemini 模型。谷歌内部评估显示,若败诉可能面临高达 1000 亿美元的潜在罚款。
中信证券研报指出,预计 2026 年文化 IP 数字化运营将为出版业带来约 700 亿元增量空间。大模型训练亟需优质语料,出版企业拥有的清晰版权归属及垂类内容优势,使其有望跨越技术周期,成为 AI 时代的核心资产。

