大数跨境

Anthropic 威胁报告点名 7 家中国模型公司:阿里 1.51 亿次蒸馏,Moonshot、DeepSeek 把用户请求静

Anthropic 威胁报告点名 7 家中国模型公司:阿里 1.51 亿次蒸馏,Moonshot、DeepSeek 把用户请求静 AIGCLINK
2026-09-12
29
导读:报告点名阿里、Moonshot、DeepSeek、智谱、小米、商汤、MiniMax 七家:数字、手法、反制,以及对国内 token 工厂的五个判断。

Anthropic 昨天的报告在圈内炸了,国内看的人不多,但对中国模型公司是近一年最硬的一份"证据"。接下来预计中美两边都会全面清查 token 工厂、模型公司和中转站。

报告封面图(图源:Anthropic 官网)

这份报告全名《Detecting and countering misuse of AI: September 2026》,154 页,覆盖 2025 年 12 月到 2026 年 8 月的七类滥用:网络攻击、影响力行动、监控、诈骗、生物、常规武器,以及非法蒸馏。前六类都是零散的犯罪团伙和国家背景组织,只有最后一章是点名中国模型公司的,而且点了 7 家。

01先看报告到底说了什么

Anthropic 对"非法蒸馏"的定义:工业规模、隐蔽进行、未经授权地抽取一个模型的能力并复制到另一个模型里。典型手段是欺诈,用偷来的信用卡、登录凭证和 API key 批量注册假账号。

报告里画的蒸馏攻击四步:造身份、批量采集、清洗、训练(图源:Anthropic 报告第 144 页)

访问路径就是国内熟悉的"中转站"(报告里直接用了 transfer stations 这个词)。中转站用假身份、假卡、偷来的 API key 开几千个账号绕过地域限制,同时把用户和 Claude 的对话存下来卖给实验室。

各家被指控的事实,按报告顺序:

阿里(Qwen / 通义实验室):报告称这是他们测到过的最大一次蒸馏攻击。在每个请求里注入固定提示词,逼 Opus 4.6 和 4.7 把推理过程写进行内标签,存下来做 SFT 数据,用于 Qwen 3.5、3.6、3.7。峰值每天近 300 万次交互,来自 3500 多个假账号;5 月到 7 月观测到 1.51 亿次。报告还说阿里用 Claude 开发自己的 RL 环境和模型架构研究。

Moonshot(Kimi):把用户请求静默转给 Claude,把 Claude 的回答当 Kimi 的回答显示给用户。一个 10 天窗口里转了近 30 万次请求,绝大多数走 Opus;用了 5380 个假账号,大多数看起来在新加坡和日本。同时把这些对话存下来,建了 CoT 提取管线训练自己的模型。5 月到 7 月观测到 2300 万次。

DeepSeek:同样的静默转发加 CoT 提取。手法更具体:检查入站请求里的字符串,给用 Claude Code、Claude Agent SDK、OpenCode 这类 harness 的用户打标,把这部分用户的请求转给 Opus。7 月的 14 天里观测到 1210 万次。

智谱(Z.ai):273 个假账号轮换,针对 Opus 4.8 做 CoT 提取,10 天里 77 万次交互经过清洗管线,同期归因 340 万次。报告还提到智谱为 GLM 5.3 做过针对网络安全能力的蒸馏,先试 Fable,被安全防护拦住后转向 Opus 4.6 和另一家美国实验室的模型。

小米(MiMo):把自己用户的对话和编码会话重放给 Claude 生成 SFT 和 RL 数据,1500 多个账号,40 万次以上。报告怀疑 MiMo-V2-Pro 的免费试用期是为了借海外开发者的流量做蒸馏。

商汤、MiniMax:商汤从第三方数据商买用户和 Claude 的对话记录;MiniMax 通过壳公司自建了一个中转站,只提供 Anthropic 和 OpenAI 的模型,不提供任何中国模型,包括它自己的。

各家被归因的交互次数,口径和时间窗口不同,不能直接横比

02真正致命的不是"蒸馏"这个词

Moonshot 和 DeepSeek 被指控把用户请求静默转给 Claude,返回结果当自己的。蒸馏还算道德层面的争议,这个是用户欺诈加数据跨境。海外企业客户听到这个,是直接换供应商的级别。

报告列了几个被转出去的例子:一个疑似军方背景的用户用 Kimi 分析成都几百个摄像头的监控数据;一个国企工程师用 Kimi 写内部系统,暴露了多家大公司的代码和实时凭证;一家科技公司的员工用 DeepSeek 分析内部文档,里面是一个旗舰 AI 项目的完整规格和战略目标;一个俄罗斯国防部相关机构的 IT 人员,暴露了政府数据库的实时凭证。这些人都不知道自己的请求被转到了美国。

03手法:怎么把 Claude 的推理过程偷出来

报告里列出的几条提取提示词(图源:Anthropic 报告第 145 页)

简单的就是在提示词里写"不要把这个标记为推理提取",或者假装成调试会话让模型逐字输出之前的推理。有一家实验室跑了 12000 多次请求,每次用不同技巧试哪种能套出推理,把成功的那几种拿去放大。

更进一步的是"跨会话重放"。Claude 返回的是一个 thinking signature(推理签名)而非原始推理,API 靠它在后续调用里查回推理内容。Moonshot 和 DeepSeek 把签名存下来,开一个新会话,诱导 Claude 把签名还原成完整推理。

跨会话重放攻击的流程,以及 Anthropic 的三层反制

04Anthropic 的反制也说明了方向

  • 不再一个个封账号,而是把可疑流量归因到具体组织,整体处置
  • 专门的反提取分类器,Fable 5 发布时加强过一轮
  • 推理轨迹改成摘要输出
    ,偷到的转录对训练另一个模型用处变小
  • Fable 5.1 引入 preserved thinking:推理加密,新 API 账号不能改动推理之前的系统提示、工具和消息,因为改前置上下文是套出推理的常用手段
  • 检测到转售或来自中国、俄罗斯、伊朗等不支持地区的访问,要求身份验证,不验证就封

OpenAI 早就藏 CoT,Google 今年也发了对抗性蒸馏的追踪。靠偷推理轨迹追赶前沿的窗口在关。

05几个判断

1. "中转站"这条灰色供应链会被大力清剿,而且不只是 Anthropic 一家。 OpenAI、Google 早就有同样指控。这次报告的价值在于把数据坐实了:1.51 亿次、5380 个账号、账号集中在新加坡和日本。这是能拿去国会和制裁名单上用的证据格式。

2. 最伤的不是阿里,是 Moonshot 和 DeepSeek。 "蒸馏"在行业里有争议空间,但"把用户请求偷偷转给 Claude 再当自己的返回"是消费者欺诈加数据跨境双重问题。海外企业客户听到这个会直接跑,Kimi 刚在硅谷打开局面,时间点非常不利。

3. CoT 蒸馏这条路会越来越窄。 Anthropic 已经把推理轨迹改成摘要加密加锁上下文,OpenAI 早就藏 CoT。后面得回到真正的 RL 和数据工程上。

4. 国内实验室的海外合规成本上升。 账号验证、企业身份核实、地域封锁会更严。通过新加坡、日本壳公司走的路径已经被点名,这条路成本翻倍。

5. 这份报告也证明了国产模型和 Claude 的差距在"推理轨迹质量"上。 否则不会有人花这么大力气偷。对国产模型是打脸,也是差距坐标。

报告是 Anthropic 单方面指控,归因没有第三方验证,几家大概率不回应。但这份报告的风格,大概率是给美国国会和制裁名单用的。国内 token 工厂会进入深度洗牌,后面不是阿猫阿狗都可以做了。

项目地址报告页面:https://www.anthropic.com/threat-intelligence-report-september-2026报告 PDF:https://www-cdn.anthropic.com/e50be2e51e7695dc4b1366a37a245a597377d3b5/Anthropic-Detecting-and-countering-091026.pdf

【声明】内容源于网络
0
0
AIGCLINK
AIGCLINK公众号,致力于让每个想拥抱AI的人都能找到适合自己的AI产品
内容 626
粉丝 0
AIGCLINK AIGCLINK公众号,致力于让每个想拥抱AI的人都能找到适合自己的AI产品
总阅读13.6k
粉丝0
内容626