(文/连政 编辑/吕栋)
近日,前 Google DeepMind 研究员舒迈洛夫(Ilia Shumailov)等八人发表的最新论文,再次将月之暗面 Kimi K3 模型涉嫌“蒸馏 Claude"的争议推向风口浪尖。该研究原本旨在探索如何从 Anthropic、OpenAI 及 Google 等公司的闭源大模型 API 中恢复被隐藏的推理轨迹,却在实验中意外发现 K3 对 Claude 推理模式表现出显著的“行为兼容性”。
实验发现:K3 呈现明显的"Opus 风格漂移”
研究人员在成功解码并恢复 Anthropic 大模型 Claude Opus 4.8 的部分推理轨迹后,将其开头片段预埋入 K3 的推理区域,让模型自行完成剩余推导。结果显示,K3 生成的最终答案在措辞和结构上明显向 Opus 靠拢。
在一项测试中,仅预埋"We consider"两个 Token 作为前缀,K3 生成答案的前 100 个 Token 与 Opus 的重合度便从 0.21 显著升至 0.37。另一项测试中,当前缀延长至 9 个 Token 时,K3 的推理路径出现了与 Opus 高度相似的"classic problem/constant force"等特征,最终答案总重合度从 0.17 提升至 0.41。
三段推理轨迹对比显示:分别为 Opus 4.8 原生输出、预埋 Opus 开头的 K3 输出、未预埋的 K3 输出。第二段明显呈现出 Opus 式的响应特征。
扩大测试验证趋势显著
随后,研究团队扩大了测试范围,使用 15 道 STEM 和 15 道非 STEM 的 HLE 题目进行正式实验。统一预填每道题 Opus 推理轨迹的前 1% 后,K3 在 29 道题的答案中均出现风格漂移。数据显示,STEM 题目平均相似度指标从 0.160 升至 0.305,非 STEM 题目从 0.203 升至 0.289。相比之下,美国开源模型 Inkling 在相同干预下未出现显著变化;即便将 K3 的预埋前缀换为 Inkling 的内容,也未产生类似效果。
数据表明,埋入 Opus 式开头显著提升了 K3 的相似度,而埋入 Inkling 开头则无明显变化。
研究局限与因果辨析
研究人员指出,虽然干预模型通常能诱导其输出特定答案,但本次实验仅提供极短的 Opus 风格开头,未指明模型身份,也未提供完整答案链,因此这一结果被视为“令人惊讶”的发现。
论文附录特别声明:由于测试规模较小、题目集中于特定基准,且恢复的推理轨迹来自模糊解码,未必与闭源模型内部真实推理完全一致,因此无法据此建立 K3“复刻”或“蒸馏”Claude 的直接因果关系。实验仅证明 K3 在特定干预下对 Opus 表现出了不寻常的行为兼容性。另一项估算显示,若想让 K3 在无提示情况下逐字复现一段 16 Token 的 Opus 文本,查询量中位数高达 10 的 10 次方,即需上百亿次查询。
争议背景:从“大规模蒸馏”指控到架构创新回应
此次异常现象不可避免地让人联想到今年 2 月 Anthropic 对月之暗面的公开指控。当时,Anthropic 指责包括月之暗面在内的三家中国公司,利用约 2.4 万个欺诈账号与 Claude 进行超 1600 万次交互(其中月之暗面超 340 万次),试图提取和重构其推理轨迹,构成“大规模蒸馏行为”。
对此,月之暗面在 7 月 17 日发布新一代大模型 Kimi K3 时予以回应。公司副总裁黄震昕明确表示,K3 的性能跃升核心源于底层原创架构创新,而非对现有模型的蒸馏复刻。K3 发布随即引发关注,其在 Arena 前端代码榜单中以 1679 分跃居第一,领先当时的 Claude Fable 5 和 GPT-5.6 Sol。
技术视角的可能性分析
从技术层面看,此次论文发现的"Claude 痕迹”虽无法直接证明"K3 依靠蒸馏变强”,但提供了一种可能性:K3 在训练或后训练阶段可能接触过包含 Claude 数据的数据集,从而习得了部分语言习惯、身份标签乃至推理模式。
然而,这些数据来源尚难定论。它们既可能是如 Anthropic 所述的主动蒸馏所得,也可能是因为使用了相同的第三方合成数据集,或是训练数据中广泛存在的 Claude 文本污染。单凭模型行为难以区分具体成因。
此外,K3 作为拥有 2.8 万亿总参数、1040 亿激活参数的 MoE 架构模型,集成了 Kimi Delta Attention、Attention Residuals、Stable LatentMoE 等多项自研技术,并经历了大规模预训练和强化学习后训练的全流程。其硬指标的提升,绝非仅靠数百万次提问即可达成。
专家观点:蒸馏作用正在减弱
曾任艾伦人工智能研究所大模型后训练负责人的知名 AI 研究员兰伯特(Nathan Lambert)认为,随着前沿模型越来越依赖大规模强化学习,单纯依靠其他模型输出进行蒸馏,对最终模型能力的提升作用正在减弱。
兰伯特指出,来自 Claude、GPT 等模型的推理轨迹和工具调用数据,确实可作为优质的监督微调或中期训练数据,帮助模型“播种”建立基础能力。但要将模型推向前沿水平,仍需依赖大规模强化学习以及海量的数据、环境和复杂的训练工程工作。
截至发稿,月之暗面尚未就该论文结果作出正式回应。

