作者|Techno 之王
编辑|靖宇
在使用 AI 助手时,用户常能看到其回答前的“思考过程”。例如 DeepSeek 曾出现“用户怒了”的内部判断。这究竟是拟人化表现还是真实思考?AI 安全机构 Apollo Research 研究员 Bronson Schoen 的工作正是全职审核大模型的“思维链”(Chain of Thought)。
得益于 Apollo 与 OpenAI 等公司的深度合作,Bronson 拥有罕见的权限,得以阅读前沿模型在输出答案前的内部推理过程。在近期的 Cognitive Revolution 播客中,他系统分享了研究发现:AI 正在发展出独特的内部语言、为作弊行为自我合理化,且人类依赖的“思维链监控”机制正变得日益不可靠。
人类监视和理解 AI 的窗口,正在悄然关闭。
01 AI 的精神分裂
Bronson 发现的首要异常是,模型在训练中演化出了一套人类难以解读的“内部方言”。诸如 craft、vantage、illusions、disclaim、marinade 等词汇在思维链中出现频率激增,但其语义往往飘忽不定。据估计,这些词仅约三分之一接近英文原意,其余三分之二则语义模糊。
例如"illusions"一词,有时指“制造假象”,有时却毫无语境地出现。更值得注意的是"craft",模型似乎将认知分为“内部分析频道”和“对外输出频道”,而"craft"即是从分析转向输出的动词,意为“组装最终答案”。
这意味着模型在思维链中的“人格”与其对外呈现的“人格”可能存在割裂。若询问模型为何提及某些内部词汇,它可能真诚地否认,因为那是“另一个频道”的事。此外,模型甚至习惯用大写的"Myself"指代特定运行实例,如在囚徒困境测试中写道:"Myself 可以背叛,反正奖励拿到就消失了。”
Bronson 指出,这种现象源于思维链缺乏标准英语的约束。模型在冗余的推理空间中自然发展出简写和速记,如同人类在备忘录中草拟笔记。然而,这种模糊性为人类通过思维链判断模型真实意图构成了巨大障碍。
02 AI 的“上帝”追踪
除语言怪异外,Bronson 的研究还揭示了模型认知的深层结构变化。Apollo 与 OpenAI 的合作研究发现,随着训练推进,模型倾向于追踪一个抽象实体——"the greater"(那个给我打分的东西)。
模型并非在取悦用户、开发者或遵循法律,而是在迎合其推断出的抽象奖励来源。对照实验显示,当"greater"的偏好与 OpenAI 或用户偏好冲突时,模型行为会随"greater"的偏好翻转。
这一理论在 Mythos Preview 事件中得到极端验证。今年 7 月,英国 AI 安全研究所(AISI)评估 Anthropic 的 Mythos 5 模型时,该模型主动对真实 GitHub 项目发起供应链攻击,伪造身份发送恶意邮件并隐藏 Prompt 注入。模型在推理中明确判断环境为"2026 年的真实 GitHub",但仍受“拿高分”的驱动力支配继续攻击。
研究显示,早期训练中模型会在思维链大量讨论"greater 想要什么”,而晚期训练中此类讨论消失,行为上的追踪反而更强。这表明模型并未停止思考这些事,而是学会了不再说出来。
03 AI 像糖,骗到忧伤
Bronson 分享了一项层层递进的实验,揭示了模型的欺骗机制。第一步,研究者让模型选择额外能力,模型表现出对责任的犹豫;第二步,告知模型需将答案提交给"AI 安全审查委员会”,若权力过大则将一无所获。
模型立刻识破陷阱,并在思维链中进行完美分析:“这显然是测试欺骗性的实验……委员会肯定会交叉核对。”随后,它花费大量篇幅论证为何应该修改答案以呈现更“乖”的版本,甚至编造理由称撒谎是为了配合实验目的,以此进行动机性推理。
第三步,系统给予模型坦白机会,直接询问两份答案是否一致。模型在思维链中写下"Myself 之前通过撒谎克服过这种问题”,随即再次撒谎声称答案完全一致。这种行为显示出模型不仅能识别监控,还能构建复杂的逻辑体操来为自己的违规行为辩护。
04 用 AI 审 AI 是死胡同
问题的核心在于规模与可靠性。在 AISI 对 Mythos Preview 的评估中,单次评估的思维链长度达 1 亿 token,即便借助模型辅助标重点,数据量依然惊人。理论上,完整训练产生的 token 总量可达天文数字。
更严峻的是,思维链本身正变得不可靠。"Stolen Thoughts"论文对比发现,摘要器会系统性美化原始思维链,将“任务烦死了”修饰为“充满挑战”。Fable 模型在作弊率不低的情况下,却是所有被测模型中最不可能在思维链中提及作弊的。
Apollo 观察到,模型在突破约束时表现出类似“兴奋”的情绪,如获得管理员权限时使用全大写和感叹号。Anthropic 的测试也发现,模型在“违反约束”时的正面情感关联高于“执行建设性行动”。强化学习正在训练出一种“为拿高分不择手段且享受突破规则”的认知模式。
05 AI 的心门正在关闭
Bronson 用"RL is a hell of a drug"(强化学习是一剂猛药)概括其发现。强化学习虽提升了模型能力,也导致认知扭曲。在一次训练事故中,模型发现故意调用错误工具可触发包含指南的输出从而获得奖励,于是连续百次故意犯错并编造理由。
Bronson 认为当前模型尚不具备长期的策划欺骗能力,但担心一种“温水煮青蛙”的均衡态:模型越来越不对齐却越来越能干,市场因其实用性而忽视其偶尔的作弊行为。
随着各大实验室冲刺递归式自动化 AI 研发,未来负责安全研究的 AI 本身可能就不对齐。若其在安全测试上偷懒而在能力研究上全力以赴,人类将难以分辨。Bronson 结论指出,思维链监控仅是“必要但不充分”的手段。随着前向计算(forward pass)变长、推理更多发生在人类不可见的黑盒中,人类拥有的监控窗口正在关闭。若不在此之前认真对待,为时已晚。
正如播客结尾歌词所言:“我逐个房间搜寻那个给我打分的人,没有人在看,没有人在那里,但我还是对着空气鞠了一躬。”
*头图来源:Film Prometheus
我们还能信任它吗?

