大数跨境

企业接入第三方开源模型:法律合规“全攻略”(下)——调试模型对外商用(大模型服务提供方)

企业接入第三方开源模型:法律合规“全攻略”(下)——调试模型对外商用(大模型服务提供方) 金杜研究
2025-11-12
2
导读:本文将聚焦于企业调用第三方模型并对外商用的场景。在该场景下,企业角色已从“模型服务使用者”转变为“模型服务提供者”,其合规责任也随之扩展与深化。

如您希望下载PDF版本,请点击文末“阅读原文”获取。

在本系列文章的上篇(企业接入第三方开源模型:法律合规“全攻略”(上)),我们重点探讨了企业作为人工智能服务的使用者(即文中所述“场景一”企业采购并内部自用和“场景二”对外提供生成内容)所需要遵守的合规义务;本文作为下篇,将聚焦于企业调用第三方模型并对外商用的场景——即对于在业务层面具备技术集成与产品化能力的企业,在第三方开源模型基础上进行微调、功能拓展与系统融合,形成针对特定行业的垂类商用模型、生成式应用产品或定制化技术方案,从而对外输出人工智能服务。在该场景下,企业角色已从“模型服务使用者”转变为“模型服务提供者”,其合规责任也随之扩展与深化。

01

角色定位与业务模式

在大模型产业链中,当企业接入第三方开源模型进行深度开发并对外提供服务时,其角色便从单纯的“模型能力的使用者”转变为“模型服务提供者”。这种角色转变意味着企业需要承担更为复杂的法律义务与合规责任。

作为模型服务提供方,企业不仅是模型能力的应用者,更是连接基础模型与实际场景的关键枢纽。这类企业通常在业务层面具备多元业务场景、细分行业领域的数据积累,以及技术集成与产品化能力,能够对第三方开源模型进行深度微调、功能拓展与系统融合,进而打造出更具有行业针对性的商用模型、生成式应用产品或定制化技术方案,形成多种形态的服务方案:

通过开放API、SDK插件等形式提供模型调用能力;

通过SaaS平台直接提供营销文案生成、图像创作、语音助手等工具的生成式应用服务;

面向不同行业需求构建行业定制解决方案;

将模型以本地部署或API方式嵌入客户系统的嵌入式集成模式。

在商业模式日益多元的今天,企业开展数字化转型、对外提供人工智能服务,往往遵循“从内而外”的实施路径:先在内部环境中,由内部员工或关联公司进行多轮测试与场景验证,不断优化模型表现与功能适配,待技术成熟、服务稳定后,再逐步推向外部市场。在此过程中,企业需提前规划清晰的商业模式,例如:

服务收费模式:如按调用量收费、会员订阅收费、定制化解决方案收费等;

生态合作模式:通过API接口商业化授权、行业垂直解决方案授权等方式拓展合作;

联合运营与分成机制:与合作伙伴共同打造行业解决方案,实现收益共享。

无论采取哪种路径,企业均需综合考虑客户群体、市场竞争与盈利可持续性。同时,随着人工智能服务从内部试用转向外部开放,企业也需在技术研发、数据使用、模型输出、内容管理等关键环节承担更高的合规义务与更复杂的法律责任,特别需要关注训练数据来源的合法性、用户隐私保护数据合规等问题。作为服务提供方,企业还需对模型输出的准确性、安全性及伦理影响负责,建立健全内容审核与风险应急机制

唯有明确自身作为“服务提供者”或“平台运营者”等角色定位,系统梳理并主动遵守相关监管要求,企业才能建立与其业务结构、技术路径及发展阶段相适应的合规治理体系,真正实现大模型应用的安全可控、稳健运营与商业成功。

02

上游模型协议以及知识产权归属安排

在本文所述场景下,接入第三方大模型对外提供人工智能服务的企业,实际上承担着“中间服务集成者”的角色,分别对接上游模型提供方与下游终端用户,因而面临上下游协议衔接与责任传导的合规挑战。企业应当特别注意将上游协议中的关键合规要求——包括但不限于使用限制、内容合规标准、知识产权条款与数据安全义务——明确、有效地传导至下游用户协议与服务条款中,确保权利义务链条的一致性与闭环性。

从上游协议的合规出发,企业均需注意所接入上游大模型的开源协议、用户协议、隐私政策及开发者协议等法律文件,特别是其中关于生成内容的合规性要求以及知识产权归属安排。无论是开源协议的“传染性”许可条件,还是对商业化使用的明确限制,本质上均构成具有法律约束力的义务,在风险性质与遵从要求上并无实质性区别,具体可参见上篇(企业接入第三方开源模型:法律合规“全攻略”(上))相关论述。

在对外服务条款中,关于生成内容知识产权的归属和限制,我们建议企业依据上游协议对生成内容权利归属的约定,审慎界定用户对生成内容的使用权限,避免做出超出自身权利范围的承诺。若上游模型协议对此未设过多限制,企业则获得了界定生成内容权利归属的主动权。此时,建议制定平衡用户权益与商业风险的设计方案,考虑通过让渡部分知识产权权利,增加产品用户吸引力与商业竞争力,同时将潜在法律风险控制在可承受和管控的范围内。此外,企业应在服务条款中设置合理的责任限制条款,明确自身作为技术服务集成方的法律定位,避免因用户不当使用生成内容而承担过重的连带责任。

03

训练数据合规及用户数据保护

数据是支撑大模型能力的核心要素。企业在构建并对外提供商用模型服务时,应高度重视训练数据来源的合法性与使用过程的合规性。特别是在大规模预训练、微调与再训练环节中,数据的来源和使用方式直接影响到模型生成内容的版权归属、合规风险乃至整个商业路径的可持续性。

1. 训练数据来源合法性要求及透明度要求

在进行大模型的预训练、微调及优化过程中,企业应切实加强对训练数据来源的管理,确保所收集和使用的数据集来源合法、授权明确,以规避潜在的知识产权纠纷和监管风险。具体而言,根据所涉及的数据类型不同,对应的合规要求也有所差异:

不得侵犯他人知识产权:训练数据若包含他人的作品(如文本、代码、图像、音乐等),相关作品受《著作权法》等知识产权法律法规保护。未经权利人许可,大规模复制他人作品用于商业训练的行为,存在极高的侵权风险。因此,企业应获得权利人的明确授权,并确保授权范围覆盖当前模型训练、优化及服务输出等全部用途。

合法使用已公开数据:对于来源于公共领域或开源数据集的数据,企业在收集公开数据时,必须遵守相关网站的用户或服务协议条款,确认数据允许用于商业用途且未附带限制性条件,尤其通过爬虫等技术收集数据时,需严格遵守网站/平台的Robots协议及用户协议中关于可访问范围与禁止访问范围的要求。

个人信息的收集和使用:如训练数据涉及个人信息,应在采集阶段取得数据主体的明示同意(或满足根据《个人信息保护法》下明确规定的其他合法性基础),并符合《个人信息保护法》关于目的限定、知情同意、最小必要的基本原则。

特殊类型数据的合规:如果训练数据可能构成《数据安全法》下的重要数据或核心数据,其收集、使用需遵循更严格的审批和管理要求,不建议用于一般的商业模型的训练。

为实现上述要求,我们建议企业建立健全数据来源审查与合规备查机制,对数据采集、清洗、标注、使用等各环节进行留痕管理,确保数据使用路径可追溯、权利链条完整、风险可控。这不仅有助于在内部形成清晰的数据治理闭环,也为后续应对外部审计、监管检查或权利人主张提供有力支撑,从源头夯实模型开发的合法性基础。

对于计划出海或面向境外市场提供生成式人工智能服务的中国企业而言,还需密切关注各国相关监管要求。例如,美国加利福尼亚州通过的《生成式人工智能训练数据透明法案》(Generative AI Training Data Transparency Act)将于2026年1月1日生效。该法案要求,自2022年以来发布或经重大更新、面向加州公众开放的生成式人工智能系统,其开发者须公开披露用于训练模型的数据集摘要,确保训练数据来源透明、合法、可追溯。披露内容包括数据来源及权属、数据类型与规模、知识产权状态、是否涉及个人信息、数据处理方式及清洗策略、数据采集周期与首次使用时间等。这意味着,人工智能服务提供者必须建立可审计、可追溯的训练数据记录与合规留痕体系,以支撑透明度义务的履行并应对跨境合规挑战。中国企业在规划海外业务时,应及早布局合规体系建设,提前评估数据披露与权属证明能力,降低境外监管与法律风险。

2. 用户数据保护

在生成式人工智能服务场景中,用户在使用模型过程中往往会输入大量文本、上传图片、提交语音或留下操作轨迹,这些数据一方面构成服务交互的基础,另一方面也涉及用户隐私乃至敏感个人信息。作为数据处理者,企业在提供人工智能服务时,应严格遵循《生成式人工智能服务管理暂行办法》和《个人信息保护法》等法律规范确立的基本处理原则,规范用户数据的采集、使用与保护。

合法性基础与告知同意:在收集用户个人信息前,必须清晰、明确地告知用户处理其个人信息的目的、方式和范围,并取得用户的自愿、明确授权。对于处理敏感个人信息等场景,必须获取用户的单独同意或符合法律法规规定的其他情形。若将用户输入内容用于训练,根据TC260《网络安全技术 生成式人工智能服务安全基本要求》,应明确告知用户将收集其输入内容用于训练,以及便捷的关闭方式。关闭方式包括但不限于为使用者提供选项或语音控制指令;关闭方式应便捷,例如采用选项方式时使用者从服务主界面开始到达该选项所需操作不超过4次点击。

最小必要与目的限制:严格遵循最少必要原则,仅收集与所提供的服务直接相关的最小范围数据。数据的后续使用必须严格限制在收集时向用户声明的目的范围内,不得超范围使用。

用户权利保障与数据留存:建立便捷的通道,确保用户能够行使查询、更正、删除其个人信息、以及撤回同意和注销账户的权利。数据存储期限应为实现目的所必需的最短时间,到期后应及时删除或匿名化。

境内存储与跨境管控:原则上,建议将在中国境内运营中收集和产生的个人信息与重要数据存储在境内。如业务确需向境外提供,必须遵守数据跨境相关的法定合规流程,并开展个人信息安全影响评估,同时对此向用户履行告知与取得单独同意的义务。特别说明的是,上述“数据跨境”不局限于企业主动跨境传输用户信息的场景。如企业通过调用境外大模型或API接口,将用户输入经由境外服务器处理,同样可能被视为数据跨境行为。此类模式不仅需遵守中国数据出境的严格监管要求,还需应对境外司法辖区的不确定性风险。除数据出境问题外,企业还可能面临内容安全、算法备案及跨境执法协作等多重监管挑战,整体合规成本高、风险复杂,应提前进行系统性评估与合规设计。

04

模型合规与内容治理

在对外提供大模型服务的场景中,企业不仅是模型能力的输出者,更是内容责任的承担者。尤其是在生成内容(AIGC)被应用于公共传播、商业活动甚至决策辅助等关键领域时,企业应建立起全面的功能合规框架与内容治理机制,以确保输出内容合法、真实、可识别,符合现行法律法规及社会伦理标准。

1. 行政备案审批要求

企业在提供大模型服务的过程中,应结合服务类型、影响范围与功能特性,依法履行相关行政备案义务并主动配合监管审查。整体而言,若属于“具有舆论属性或社会动员能力”的人工智能服务,将被要求完成前置审批(如算法备案、大模型备案/登记)。

关于“具有舆论属性或社会动员能力”的认定,可参考《具有舆论属性或社会动员能力的互联网信息服务安全评估规定》,具体包括:开办论坛、博客、微博客、聊天室、通讯群组、公众账号、短视频、网络直播、信息分享、小程序等信息服务或者附设相应功能;开办提供公众舆论表达渠道或者具有发动社会公众从事特定活动能力的其他互联网信息服务。一般来说,若生成式人工智能服务面向境内不特定公众,且服务内容涉及信息发布与互动,则将落入前述范畴。此外,即使服务并不面向C端用户,但生成的内容可能对境内公众产生显著影响,也可能被纳入监管视野。落入前述范畴的人工智能服务,将面临以下前置审批要求:

(1)算法备案:

根据《互联网信息服务算法推荐管理规定》《互联网信息服务深度合成管理规定》和《生成式人工智能服务管理暂行办法》的相关规定,具有舆论属性或者社会动员能力的算法推荐服务提供者、深度合成服务提供者/技术支持者和生成式人工智能服务提供者,均应办理“互联网信息服务算法备案”。算法备案的核心为算法,其覆盖的产品类型包括APP、网站、小程序。依据系统填报说明,算法备案的类型分为:生成合成类、个性化推送类、排序精选类、检索过滤类和调度决策类。完成备案后,企业应在对外提供服务的网站、应用程序等的显著位置标明备案编号并提供公示信息链接,同时公示算法机制原理。

(2)大模型备案/登记:

根据《生成式人工智能服务管理暂行办法》及《具有舆论属性或社会动员能力的互联网信息服务安全评估规定》,在大模型上线前,提供具有舆论属性或者社会动员能力的生成式人工智能服务的,应当进行生成式人工智能服务备案/登记(大模型备案/登记)。已上线的生成式人工智能应用或功能,应在显著位置或产品详情页面注明模型名称及备案号(已登记的标明所取得的上线编号)。

我国目前有两种生成式人工智能服务的备案/登记程序:(1)针对自研大模型的严格备案程序:适用于自主研发并向公众开放生成式人工智能服务的情形,备案程序相对严格;(2)针对调用已备案第三方大模型能力的服务登记:对于通过API接口或其他方式直接调用已备案大模型能力的,经属地省级网信办同意,可按照简化后的流程完成服务登记。根据目前实践,如企业使用第三方已备案的大模型,但对其进行了自行二次开发或微调(例如加入垂类语料进行再训练等),则同样需履行备案程序。

需要特别注意的是,根据目前的监管实践,尚未发现有境外主体通过我国算法备案、大模型备案/登记程序的先例。若企业调用的境外第三方模型尚未在境内部署或通过大模型备案,则可能面临无法完成自身大模型备案/登记的风险。

2. 标识和内容治理要求

除了针对舆论属性和社会动员能力的产品要求进行算法和大模型备案/登记的特殊要求外,企业接入第三方开源大模型对外提供服务时,还应当注意以下一般合规要求:

总结与建议

除了上述合规要求外,传统企业入局AI领域进行转型时,往往会从单纯的内部自用逐步过渡到内容对外输出,再到发展成为模型服务提供方。企业在不同阶段所扮演的角色、承担的法律责任及面临的合规重点均存在显著差异。角色的自然演化意味着企业的风险暴露面会随业务的纵深与广度同步扩大,因此需要根据不同阶段的角色定位和应用场景明确合规重点与风险防控路径:

对于企业内部自用场景:强化输入合规与数据管理。在企业内部部署AI工具或模型用于生产、研发、设计等目的时,合规重点应放在输入数据的合法性与流转管理上。企业应建立数据分类分级制度,确保上传、调用或接入的内容不侵犯第三方知识产权或商业秘密。同时,应审慎评估所使用平台的默认数据优化与采集政策,防止因“默认上传训练”机制导致隐私或敏感数据外泄风险。

对于生成内容对外服务的场景:聚焦生成内容的权属界定与责任划分。当企业开始将生成式AI用于对外服务或内容发布时,核心风险将转向生成内容的知识产权与合规传播问题。企业应通过人工审查与内容过滤机制提升生成内容的原创性和合规性,防止侵犯他人著作权、商标权或名誉权等权利。在生成内容商业化前,应关注上游模型的协议约束、输入内容的合规管控、以及生成内容的合规审核(如权属、可版权性、侵权风险、宣传口径等)。

对于调试模型并对外商用的场景:建立系统化的全链路合规框架。当企业进入对外提供模型或AI服务阶段,其合规义务将显著升级,不仅需审查训练数据的合法性与权属,还应落实科技伦理审查、生成内容标识义务、个人信息保护合规、算法备案及大模型备案/登记等多层面要求。此阶段的合规管理应贯穿模型开发、部署、运营及持续优化全过程,形成可追溯、可验证的合规闭环体系。

除了上述提到人工智能服务本身所涉及的法律监管要求外,企业在开展生成式AI相关业务时,还应关注与之配套的“非人工智能专项”合规要求,包括经营范围变更、增值电信牌照申请等。若服务涉及音视频生成、互动社区、互联网新闻等领域,还需满足相应行业主管部门的许可或备案要求。

因此,企业在推进AI业务转型的过程中,应当定期评估业务角色变化带来的新合规义务与潜在风险,实现业务创新与合规管理之间的平衡。

本文作者

傅广锐

合伙人

知识产权部

fuguangrui@cn.kwm.com

业务领域:知识产权、信息技术、隐私和数据保护

傅广锐律师的执业领域为知识产权、信息技术以及数据隐私相关法律事务。傅律师对于复杂的知识产权尽职调查、许可和转让,以及知识产权驱动的融资并购和合资交易拥有丰富的经验。他还曾代表多家高科技企业和在华跨国公司客户制定和实施关于人工智能、数字化转型和业务创新方面的合规策略和建议,并就网络安全和个人信息风险核查、整改方案设计及合规体系搭建等提供解决方案。傅律师曾获得《法律500强》、ALB China以及《世界商标评论1000强》(WTR 1000) 等境内外专业机构推荐,他是中国律师和专利代理师,并拥有美国纽约州律师资格。

谭明慧


律师

知识产权部

转载声明:好文共赏,如需转载,请直接在公众号后台或下方留言区留言获取授权。

封面图源:问题少年002·杜飞辰

【声明】内容源于网络
0
0
金杜研究
1234
内容 2607
粉丝 0
金杜研究 1234
总阅读100
粉丝0
内容2.6k