大数跨境

谱子们的蒸馏,老美拦不住

谱子们的蒸馏,老美拦不住 透明故事
2026-09-09
3

美方报告指控国模“恶意蒸馏”,中方回应:技术正当且无攻击性

美方近日发布官方报告,详细分析了中国大模型对美国模型的蒸馏行为,并点名深度求索(DeepSeek)、智谱、阿里巴巴等六家企业。报告一方面承认“蒸馏是 AI 研究中正当且有用的技术”,另一方面却指责中方实施“攻击性、恶意且有针对性的蒸馏活动”。对此,中方观点明确:我们从未攻击任何人,亦无任何恶意。

深度求索:广泛蒸馏助推 R1 模型爆发

报告指出,自 2024 年起,深度求索便开始进行模型蒸馏,并于次年年初发布了具有里程碑意义的 R1 模型。针对外界质疑其仅 560 万美元的低训练成本未包含数据获取费用,事实显示,深度求索的蒸馏策略极为广泛。

如图所示,深度求索对包括 Anthropic、OpenAIGoogle 乃至早期 Grok 在内的 14 款美国模型进行了全面蒸馏,展现出“不挑食”的技术吸收能力。美方报告称,中国模型倾向于汲取各家美国模型的优势项,深度求索与月之暗面(Kimi)正是其中的典型代表。

智谱与阿里:战略路径决定蒸馏成效

不同企业的蒸馏路线与其公司战略紧密相关。智谱去年坚定押注代码(Coding)赛道,成功契合市场需求,模型口碑与 ARR(年度经常性收入)均居国产模型榜首。相比之下,某多模态主导的企业在算力储备不足的情况下,试图效仿阿里巴巴打造“全家桶”模式,导致今年模型能力与股价同步承压。

在蒸馏路径上,该企业初期模仿 Anthropic,但仅学习至 Opus 4.5 版本便转向 Gemini,错失了 Anthropic 后续版本的精华,而 Gemini 自身今年表现亦不佳。这种“追涨杀跌”式的策略被业内比喻为散户炒股,最终陷入被动。

阿里巴巴与智谱类似,采取“少而精”的蒸馏策略,主要聚焦于 Opus 4.8 和 GPT-5.5 等顶级模型;或可能因早期蒸馏较多,Opus 4.5 之后动作减少,亦不排除美方统计不全的可能。

技术博弈:反蒸馏难以阻挡国模迭代步伐

随着 GPT-6 Astra 的发布,有观点认为美国 SOTA 模型的蒸馏难度提升了 20 倍,这也是部分国产模型厂商近期市值波动的原因。然而,卖方分析认为,这无法从根本上阻止中国模型的蒸馏进程。

路径一:思维链(CoT)数据的持续挖掘

美方报告重点提及了 CoT 数据蒸馏路径。尽管 Astra 的循环机制及 Fable 5.1 的反蒸馏技术旨在拦截传统手法,但新的蒸馏技术已在路上。目前,Fable 5.1 已纳入蒸馏范围,针对 Astra 的蒸馏方案也已准备就绪。

路径二:中转站轨迹数据的独特优势

另一条未被美方报告提及的路径是“中转站轨迹数据”。此类数据仅存在于用户交互 Session 和中转留痕中,模型厂商难以完全拦截,为中国模型提供了独特的数据来源。

总体而言,当前中美 AI 竞争呈现动态平衡:美国模型性能领先中国 3 至 6 个月,而中国在蒸馏技术上同样领先对方 3 至 6 个月。双方均在快速迭代中相互追赶。

【声明】内容源于网络
0
0
透明故事
各类跨境出海行业相关资讯
内容 194
粉丝 0
透明故事 各类跨境出海行业相关资讯
总阅读4.5k
粉丝0
内容194