大数跨境

郑友德 | AI生成图像源自谁的作品?MIT研究发现这类图像难以归因于特定训练数据

郑友德 | AI生成图像源自谁的作品?MIT研究发现这类图像难以归因于特定训练数据 知产前沿
2026-09-09
6
导读:更多知产原创,请关注“知产前沿”公众号!

作者 | 郑友德
华中科技大学法学院教授

目次

一、研究缘起与主要结果

二、MIT 对自身研究结果的评价

三、外部对 MIT 研究成果的点评

四、归因衰减对版权侵权判断的潜在影响

五、结语

图 1 使用完整训练集的模型输出与逐一排除一位艺术家全部作品后的部分输出。资料来源:[1](拼图由 MIT 研究者提供)。

一、研究缘起与主要结果

当 AI 图像生成器创作出一幅图像时,究竟哪些训练作品对其产生了实质影响?这一问题关乎全球版权诉讼、许可交易及监管政策的核心。随着扩散模型的广泛应用,确定特定训练数据是否影响了模型的特定输出,已成为生成式 AI 版权争议中的关键技术难题。需明确的是,训练数据归因仅能辅助判断某作品是否影响了特定输出;而训练阶段的复制合法性、输出是否构成衍生作品及侵权责任认定,仍须依据版权法独立判断。

麻省理工学院(MIT)计算机科学与 AI 实验室的 Zheng Dai 与 David K. Gifford 近期在《自然·通讯》(Nature Communications)发表论文《生成式扩散模型的输出往往不可归因》(Outputs of Generative Diffusion Models Are Often Unattributable)。该研究聚焦于特定输出能否归因于单张训练图像、某人的全部照片或某位艺术家的全集,以及这种可归因性随训练规模变化的规律。

研究团队在七个公开图像数据集上训练了 24 个扩散集成模型,数据量从 256 张增至超 16 万张。对比实验显示,扩散集成模型与常规模型生成的图像质量相当,且随数据量增加表现更优。通过逐项排除某张图像、某人照片或某艺术家作品并观察输出变化,研究发现:训练数据越多,排除单项或某组数据后模型输出的变化越小。研究者将此现象定义为“归因衰减”(attribution decay)。

图 1 直观展示了这一结果:由 744 位艺术家作品训练的模型生成的图像,在逐一剔除某位艺术家全部作品后重新生成,结果与原图无明显差异。这表明,在该特定输出中,没有任何一位艺术家的作品表现出不可替代的单独影响,但这并不意味着相关作品未被用于训练或对模型学习无作用。

为验证该现象非模型结构特有,研究者改用传统逐项从头训练方法,在较小数据集上训练 1282 个模型,仍观察到相同趋势。无论采用何种文本提示、类别条件或图像比较方法,“归因衰减”均稳定存在。这说明该现象不能简单归因于模型结构、数据比例、训练轮次或比较方法。

需注意的是,该研究仅针对生成式扩散模型。此类模型虽广泛用于图像、视频、音频及科学领域,但“归因衰减”是否存在于大型语言模型(LLM)中尚属未知。因此,上述结论仅限于特定模型、数据及实验条件,不宜直接推及所有商用模型或 LLM。

二、MIT 对自身研究结果的评价

Dai 指出,若排除某项训练数据后模型输出未变,则无法认定该项数据影响了该输出;若逐项排除后输出均无变化,则缺乏将该输出归因于任何单项数据的充分理由。

Gifford 强调了方法论的改进:以往归因方法多依赖近似计算,无法确证排除数据后的输出变化;本研究通过实际排除被检验输入及其影响,高效地在大规模上验证了输出稳定性。

关于模型性能,Dai 指出扩散集成模型在小数据量下表现逊于常规模型,但随数据量增加差距缩小。这一评价针对生成性能,而非归因衰减程度。

在法律层面,Gifford 认为可将模型理解为具有某种创造性,因其并非单纯复制材料而是生成新内容。若输出与任何单项训练数据均无关联,将引发合理使用、输出可版权性及作者补偿等新议题。他进一步提出,企业若主张其输出不构成侵权衍生,需利用该技术进展改进模型,以证明输出非源自特定个人或材料。

综上,不可归因性可作为考察输出是否源自某项训练作品的技术证据,进而影响衍生作品认定的事实基础。然而,它仅说明在特定条件下无法将输出归因于单项数据,既不能单独证明输出不构成侵权或衍生作品,也不能直接证明其符合版权保护条件。

三、外部对 MIT 研究成果的点评

康奈尔大学法学院教授 James Grimmelmann 认为,若归因方法有效,本应能可靠区分复制与巧合;但 MIT 研究表明,对于现实意义的模型,归因方法可能失效,技术人员和法院需寻求其他判断路径。他指出,单项数据归因难以独自承担区分任务,需结合训练记录、模型版本、提示词、随机种子及生成日志等多维证据综合判断。

Fast Company 概括称,AI 可能生成与艺术家风格相近的图像,却无法证明该艺术家的作品对输出有特定因果贡献,“归因衰减”因而削弱了仅凭相似性主张复制的论证。报道同时强调,该研究未回答未经许可采集训练数据的合法性问题。

Gizmodo 使用了“无法证明作品被 AI 窃取”的绝对化标题,但其讨论范畴仍限于特定模型和训练规模下的因果溯源。所谓“无法证明”仅在研究对象内成立,不能推及训练数据来源合法性或输出是否再现受保护表达。

Google 搜索综合摘要以烹饪类比,将模型比作融会贯通的厨师,而非直接抽取片段的拼贴机。当多项数据包含重叠特征时,排除单项数据不影响模型利用其他相似特征生成输出。该类比说明了单项数据非不可替代,但不能据此判断是否构成法律意义上的复制,亦不能解答训练取材合法性问题。

此外,归因衰减使“选择退出”(opt-out)机制的验证复杂化。若排除某艺术家作品后输出无变,难以仅凭此判断其退出声明是否生效。但选择退出机制的作用不仅在于改变输出,还包括阻止数据纳入后续训练及删除数据。归因衰减限制了通过输出变化检验执行效果的方法,但未消除该机制在数据控制和许可方面的意义。

总体而言,外部评论共同揭示了归因衰减对版权证明的影响:输出相似不必然意味着实际促成。这要求司法实践结合多元证据审查,完善训练数据控制,而不能将不可归因性直接作为免责依据。

四、归因衰减对版权侵权判断的潜在影响

1. 诉讼中的证明责任
在具体诉讼中,归因测试的证明力受限于受测模型、特定输出及实验条件。主张未复制的一方需详细说明模型版本、排除数据范围、生成条件及测试结果。缺乏这些前提,个别实验结论不能推及被诉模型的其他输出,更不能转化为一般性不侵权抗辩。同理,权利人也不能仅凭相似性推定某作品促成了输出。归因证据的可复核性与案件事实的对应程度是关键。

2. 训练阶段复制行为的认定
归因测试关注单项作品与特定输出的联系,而训练阶段的数据复制是既定事实。作品是否被收集、制作成训练数据或在训练中复制,应依据训练记录和技术过程独立认定。排除某作品后输出无变化,不能否定该作品曾进入训练数据,也不改变已发生的复制行为性质。

3. 衍生作品与合理使用
在衍生作品争议中,不可归因性增加了权利人确定依据作品的难度,但不能单独决定输出性质。若输出可识别地再现了受保护表达,仍需适用版权法规则进行比对;反之,即使证明作品被用于训练,若输出未再现受保护表达,亦不构成衍生作品。
合理使用的判断需综合考察使用目的、原作性质、使用数量及市场影响。不可归因性无法直接确定训练使用的目的和性质,也不能说明使用部分的实质性或对市场的潜在影响。训练阶段的利用与输出阶段的再现属于不同行为,需分别审查。

4. 输出内容的可版权性
模型输出能否获版权保护,取决于是否包含人类独创性表达,与能否追溯至特定训练作品无关。美国版权局认为,完全由 AI 生成或人类未充分控制的内容不受保护。仅提供提示通常不足以确立作者身份。不可归因性既不能证明 AI 输出含人类独创性,也不能否定人类在其中的创作贡献。

5. 补偿机制的构建
归因衰减表明,按每项输出追溯贡献并分配报酬缺乏可靠技术依据。但这不意味着训练使用无需许可或创作者不应获偿。即使无法证明单项作品促成特定输出,补偿规则仍可基于作品被纳入训练的事实、许可约定或集体管理规则设立。

五、结语

MIT 研究的意义在于揭示:随训练数据规模扩大,单项数据与特定输出的可识别联系减弱,即“归因衰减”。这一技术发现本身不决定行为是否侵权。特定作品能否被追溯仅为证据链一环,训练使用、表达再现及责任认定仍须依各自法律要件判断。归因测试不能直接成为非侵权抗辩,亦非证明复制的唯一途径。

现有研究尚未证实归因衰减同样存在于大型语言模型,结论亦难直接适用于架构各异的商用模型。未来研究需考察不同模型、数据规模下的变化,探索集合归因等新方法。司法实践则应明确技术归因证据的适用条件与限度,厘清技术事实与法律评价的边界,准确界定各方责任。

注释(上下滑动阅览)

[1] GORDON R. When AI Art Has No Author: Study Finds Generated Images Often Can't Be Traced to Training Data [EB/OL]. MIT News, 2026-08-18.

[2] DAI Z, GIFFORD D K. Outputs of Generative Diffusion Models Are Often Unattributable [J/OL]. Nature Communications, 2026, 17: 6974. DOI: 10.1038/s41467-026-75667-5.

[3] DIAZ J. Does Generative AI Actually Copy Artists? Researchers Say It's Up for Debate [EB/OL]. Fast Company, 2026-08-21.

[4] WRIGHT W. Artists Want to Prove Their Work Was Stolen by AI. A New Study Says That's Impossible [EB/OL]. Gizmodo, 2026-08-25.

[5] GOOGLE 搜索 AI 模式。关于 MIT CSAIL 归因衰减研究的综合回答截图 [Z]. 2026-08-31.

[6] ROEMMELE B. When AI Art Has No Author: Study Finds Generated Images Often Can't Be Traced to Training Data [EB/OL]. X, 2026-08-28.

[7] UNITED STATES CONGRESS. 17 U.S.C. §101: Definitions; 17 U.S.C. §106: Exclusive Rights in Copyrighted Works [Z/OL].

[8] UNITED STATES CONGRESS. 17 U.S.C. §107: Limitations on Exclusive Rights---Fair Use [Z/OL].

[9] U.S. COPYRIGHT OFFICE. Copyright and Artificial Intelligence, Part 2: Copyrightability [R/OL]. Washington, D.C.: U.S. Copyright Office, 2025.

郑友德专栏文章
SPECIAL COLUMN

郑友德 | 美国司法部最新发声:全球博弈下的知识产权与反垄断“平衡之舞”


郑友德 | AI 辅助作品侵权判定如何从“内容导向”向“过程导向”转变?——以 Noti-Victor《后生成式 AI 的版权诉讼》为中心


郑友德 | 英国竞争与市场管理局授权媒体阻止谷歌 AI 搜索抓取其内容


郑友德 | 中美 AI 商业秘密诉讼潮将至:企业如何应对

作者:郑友德
编辑:Sharon

【声明】内容源于网络
0
0
知产前沿
各类跨境出海行业相关资讯
内容 8605
粉丝 0
知产前沿 各类跨境出海行业相关资讯
总阅读138.0k
粉丝0
内容8.6k