大数跨境

大模型“吃”了全网的语料“合理使用”与侵权的边界如何划清?|深度

大模型“吃”了全网的语料“合理使用”与侵权的边界如何划清?|深度 财联社Al daily
2026-08-28
2
文 | 王耐 顾心语

当大模型厂商竞相投入千亿算力基建时,一颗更为隐秘的“版权暗雷”正在逼近。

8 月中旬,苹果拟付数亿美元采购新闻语料的消息引发行业震动。近两年,围绕 AI 训练语料的版权诉讼已在全球蔓延:《纽约时报》起诉 OpenAI 和微软未经授权训练大模型;多位知名作家联合起诉 Anthropic、谷歌等巨头实施“蓄意盗窃”。此前,Anthropic 因滥用著作训练 AI 达成 15 亿美元和解,创下美国版权案纪录。国内方面,上海首例 AI 大模型著作权侵权案也已宣判,涉及角色形象复制权等问题。

迭代的大模型一路狂奔,背后的“版权之争”如何破局?法律上如何界定“合理使用”与“侵权”的边界?记者就此对话了相关律师、知识产权教授及出版从业者。

“按量付费”是公平交易还是定价权游戏?

苹果计划掏数亿美元买新闻版权,并提出“按量付费”的浮动报酬机制,即当合作方内容实际被 Siri 使用时才支付费用。这一动作引发了关于 AI 时代内容授权新范式的讨论。

上海财经大学竞争法与知识产权研究中心执行主任厉彦冰指出:“按量付费并非新范式,本质上仍是因 AI 使用受版权保护作品而产生的版税,计价模式在现行《版权法》中已有先例。”

然而,“按量付费”能否完全规避侵权风险?北京大成(上海)律师事务所高级合伙人傅钢强调,著作权法关注的是企业实际实施了哪些使用行为以及是否获得许可,而非费用的支付方式。“若来源方权利有瑕疵或授权范围未覆盖使用场景,即便约定按次付费,仍可能产生侵权或违约风险。”

北京市中伦文德律师事务所上海分所合伙人黄阳阳认为,在协议框架下苹果基本规避了风险,除非引用新闻本身侵犯第三方版权。但厉彦冰提醒,按量付费仅是合同条款,无法解决复制与演绎的界定难题,还带来了新的计量认定困境:一次查询调用多篇报道生成摘要,究竟算几次使用?不同环节(抓取、训练、输出)是否分类计算?目前界定尚不清晰。

技术模式的选择直接影响许可费收取,而议价权成为核心议题。厉彦冰分析:“谁掌握计量数据,谁就掌握定价解释权。”在按量付费模式下,平台掌握数据,内容商无法验证调用次数,集体议价能力被削弱。黄阳阳也指出,高质量中文内容版权分散,出版商独立且分散,导致版权方议价能力偏弱,而 AI 平台获取授权流程复杂、成本高昂。

一位出版社从业者透露,目前许多出版社对语料训练问题意识不足,态度消极被动。虽然利益共享、风险共担理论上利大于弊,但理想与现实之间存在分裂。

苹果买新闻语料引市场波动,如何分析?

苹果计划投入数亿美元获取新闻版权的消息,直接引爆 A 股"AI 语料”板块,读客文化等个股大涨。西南证券传媒首席分析师苟宇睿认为,此类行情具备情绪与主题资金轮动特征。长期来看,AI 正推动传媒内容产业从“消费品”转向“数据+IP 资产”双重定价,国内政策也在推动以词元为基础的数据集价值体系确权。

图片来源:东方财富"AI 语料”概念

苟宇睿指出,这对 A 股传媒板块估值的影响在于,让市场从“看渠道、看发行量”转向“看数据资产质量”。AI 语料叙事提供了新的成长性估值逻辑。但他也提醒,Token 价值体系落地短期偏主题弹性,能否沉淀为长期估值中枢,仍需观察后续授权交易与政策实质落地情况。

图片来源:苹果公司 2025 财年 10-K 年度报告 美国证券交易委员会(SEC)

苹果将 AI 列为 2025 年年报中的风险因素,认为 AI 技术可能涉及未经授权使用受版权保护材料,从而引发诉讼成本和监管处罚。傅钢律师认为,这表明苹果已将 AI 版权视为前置的中长期经营风险。这对国内大模型厂商的启示是:AI 语料合规应覆盖数据取得、清洗、训练、微调、索引、检索、输出和投诉处理的全流程。

花数亿美元买新闻版权,未来内容行业会重估吗?

傅钢律师预测,未来稀缺的不是“更多的数据”,而是能够被大模型持续、稳定、合规使用的高质量数据资源。大模型厂商的数据竞争将从公开抓取转向与新闻媒体、出版机构等建立长期授权合作,并通过权利清理、来源标记等手段降低合规风险。

苟宇睿持类似观点,认为大众通俗文本供应充分,真正稀缺的是高质量、独家、合规、可溯源的专业垂类数据(如医学教材、法律判例、权威新闻等)。他总结出有望受益的五类内容资产:“稀缺 + 独家 + 合规 + 可溯源 + 实时”,包括专业垂类知识、权威古籍、实时权威新闻、网文影视 IP 及数据服务类公司。

未来语料相关厂商的收入结构和估值体系可能面临重构,传统出版有望从单纯分红向“分红 + 数据/版权重估”双逻辑切换。但苟宇睿指出,兑现节奏不会太快,受限于权属复杂和工程壁垒(数字化、清洗、标注成本高),“重估”更可能发生在少数专业、独家的垂类内容持有方。

IDC 数据显示,2025 年中国人工智能基础数据服务市场规模达 62.62 亿元,同比增长 27.8%,预计 2026 年将增至 78.34 亿元。目前国内语料数据以“数据本地化 + 私有部署”为主,主要做法包括:

1. 自建或合作研发专有模型:如中信出版“夸父 AI"、中国出版“中华古籍大模型”、中文在线“逍遥”大模型等;

2. 共建国家级正版语料库:首批 22 家机构共建,坚持“先授权、后使用”,覆盖出版、传媒等领域;

3. 专业数据服务外包。

是“合理使用”还是侵权?未定论的全球争议

多位律师表示,AI 大模型训练使用版权人作品是否构成“合理使用”,是全球法律争议的焦点。AI 公司主张模型学习形成了新的技术工具和表达方式,具有“转换性”;版权方则认为训练以商业为目的,大规模复制作品甚至复现原内容,削弱了原有市场,属于侵权。

傅钢律师判断:“对大模型厂商而言,不能仅以训练具有‘转换性’作为当然抗辩;对权利人而言,也不能仅凭作品被用于训练就当然推定侵权。”黄阳阳律师也认为,未经授权复制语料不等于输出内容一定侵权,反之亦然。

关于界定标准,傅钢提出应综合考量数据来源、复制行为、模型复现能力、产品竞争性以及企业是否采取过滤措施等因素。现实中,同一业务的不同环节可能得出不同结论。例如,今年 7 月结案的“巴茨诉 Anthropic 案”中,法官认定使用正版书籍训练属于“转换性使用”,但使用盗版书籍训练则构成侵权。

傅钢指出,该案明确了“训练目的具有转换性”和“数据来源合法”是两个独立问题。但厉彦冰教授提醒,由于该案以和解终结,未产生有约束力的先例。截至目前,美国没有任何一家联邦上诉法院就 AI 训练是否构成合理使用作出过实体判决,地区法院判决也存在冲突,法律不确定性短期内难以消除。

版权保护不当,AI 将“无米下锅”?

若版权保护不当,可能导致“竭泽而渔”的后果:原创供给萎缩,AI 只能靠“复制自己”续命。皮尤研究中心研究显示,ChatGPT 问世后发布的网页中,超三分之一可能带有 AI 生成痕迹,形成机器人阅读机器人生成内容的循环。

黄阳阳律师提醒,知识凝固在模型参数中,容易产生幻觉和错误内容。更有从业者透露,上游作者大量通过人机协同创作,导致作品"AI 味”浓重,原创性认定困难。新闻报道因数量巨大、质量较高且广泛公开,成为侵权争议的重灾区。黄阳阳强调,除简单事实描述外,绝大多数新闻报道的文字表达、叙事编排均受版权保护。

上海段和段律师事务所合伙人刘春泉指出,大部分大模型企业未主动购买版权,商用前隐匿语料来源并进行技术处理,给举证带来难题。他认为,大模型语料训练是纯粹商业行为,若法院认定合理使用等于慷他人之慨帮企业节省成本,缺乏合理性。新技术发展需法律制度宽容,但也需考虑对人类作品传承的保护。

语料交易,当前有一套可落地的规则吗?

我国现行《著作权法》规定了个人学习、适当引用等合理使用情形,但未明确普遍适用于商业大模型训练的例外。多位律师认为,不能简单照搬美国“转换性使用”概念,未来裁判规则将沿分阶段、分场景方向细化,重点审查数据来源、训练方式、输出结果和市场影响。

国内已出台一系列管理办法。《生成式人工智能服务管理暂行办法》要求使用合法来源数据,不得侵害知识产权。

图片来源:《生成式人工智能服务管理暂行办法》

2025 年 11 月实施的国标《网络安全技术 生成式人工智能服务安全基本要求》明确规定:开源语料须有许可协议;自采语料须有采集记录且不采集声明不可采集的内容;商业语料须有法律效力合同及承诺证明。

图片来源:《网络安全技术 生成式人工智能服务安全基本要求》

今年 5 月,22 家机构在深圳启动“国家级正版高质量语料库”,确立“先授权、后使用”原则并引入区块链留痕,但目前仍处于共建阶段,未披露具体规模与分成方案。

厉彦冰教授表示,合规义务虽已落地,但标准化授权模板、透明定价机制、常态化授权通道及交易平台等市场基础设施尚在探索初期,存在制度落差。不过,随着技术成熟和案例增多,司法裁判将通过类型化和法律解释逐步达成共识。现代版权法加上法教义学的解释方法足以应对 AI 带来的挑战,这需要正常的更新适应过程和时间

【声明】内容源于网络
0
0
财联社Al daily
财联社及科创板日报旗下产品--未来已来,AI前沿,独家、深度、专业!
内容 4308
粉丝 0
财联社Al daily 财联社及科创板日报旗下产品--未来已来,AI前沿,独家、深度、专业!
总阅读96.0k
粉丝0
内容4.3k