大数跨境

Anthropic刚发了一篇让自己都恐惧的论文

Anthropic刚发了一篇让自己都恐惧的论文 AI科研进阶社
2026-09-29
2
导读:题目:KisMATH: Do LLMs Have Knowledge of Implicit Structur

题目:KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?

论文地址:https://arxiv.org/abs/2507.11408

代码地址:https://espressovi.github.io/KisMATH

创新点

•基于 GSM8K、MATH500、AIME 三个数学基准,得到1671 道数学题,每道题配套 LLM 推理解答 + 自动生成的 CCG 因果图。弥补了之前推理结构数据集规模极小(仅几十条人工标注样本)的短板,支持大规模因果干预实验。

•提出 CCG(Causal CoT Graph,因果思维链图)自动提取算法 设计算法从 LLM 输出的 CoT 推理轨迹里自动提取有向无环图;图节点是数学表达式,边表征表达式之间细粒度的因果依赖,把文本形式的推理步骤转化成结构化因果图。区别于过去人工标注、句子级粗粒度的推理图,它直接解析数学公式间的推导关系,可规模化生成。

方法

本文首先定义因果思维链图 CCG,将数学推理中的每个数学表达式作为图节点,节点间有向边代表推导的因果依赖关系,并设计自动化算法从大模型生成的思维链文本中提取这类结构化因果图,基于 GSM8K、MATH500 与 AIME 题库,通过该算法批量构建附带 CCG 标注的 KisMATH 数据集,之后选取参数量从 1B 到 70B 的多款开源大模型,以 CCG 里定义的推理路径 R-path 为基础开展因果反事实干预实验,通过修改推理路径上中间节点的表达式,观测模型最终输出答案的变化,以此检验中间推导节点是否充当问题到答案的因果中介,同时对比扰动推理路径内节点与路径外节点带来的效果差异,量化模型对该因果推理结构的敏感度,进而判断大模型内部是否存在和 CCG 对齐的隐式数学推理结构。

提取得到的因果图与推理路径示例

本图选取 GSM8K 数据集里一道乒乓球得分应用题作为示例,左侧展示从模型思维链推理文本中自动提取得到的简化版因果思维链图 CCG,蓝色标记出各个数学推理节点,灰色线条代表节点之间的因果推导边,把题目原始问题、每一步数学中间计算结果和最终答案都转化为图上节点,节点之间的连线代表推导依赖关系,对应完整的解题推理链条,右侧则在同一个数学题基础上展示两种不同路径,实线代表 R-path 也就是从问题直达答案的有效推理路径,虚线代表随机路径,借此直观区分真正参与推理的因果节点和无关节点,该示例用来解释论文提出的 CCG 构造逻辑,说明如何把自然语言思维链拆解为结构化因果图,并且定义后续因果干预实验所使用的推理路径,为后续修改路径节点、观测模型答案变化的实验提供可视化样例。

KisMATH 数据集内来自 MATH500 与 AIME 的 CCG 因果图样例

本图分为 (a) MATH500 子集和 (b) AIME 子集两个板块,一共展示四道不同类型的数学题目,每道题都附带模型生成的思维链推理文本以及对应的 CCG 因果图,蓝色色块标记推理过程中的关键数学节点,连线表达节点之间的因果推导依赖关系,其中 (a) 部分包含两道题目,第一道是代数求最值问题,第二道是集合容斥应用题,(b) 部分包含数论求最大质因子题目和绝对值函数最小值问题,覆盖代数、集合、数论等不同数学题型,用来直观展示论文提出的 CCG 方法可以适配不同难度、不同类型的数学推理题目,既可以处理 MATH500 这类中等难度的数学题,也能处理 AIME 竞赛级别的高难度数学推理,证明该自动提取因果图的算法在不同数学任务上都具备可用性,同时也展示了 KisMATH 数据集样本的真实形式,每道样本都保留原始问题、逐步推理过程以及拆解后的因果依赖节点结构。

GSM8K 数据集上,原始条件与路径掩码(Path Masked)条件下答案概率(H(P_A))的分布对比

本图展示在 GSM8K 数学数据集上,15 个不同架构、不同参数量(从 1B 到 70B)大模型在两种实验设置下答案概率(H(P_A))的概率分布直方图,蓝色代表原始推理条件 Original,橙色代表对 CCG 中核心推理路径 R-path 节点做掩码后的 Path Masked 条件,横轴为答案概率(H(P_A)),采用对数刻度,纵轴为概率,每个子图左上角标注 KS 检验的(D_{KS})值与 p 值,用来量化两组分布差异,所有模型都能观察到掩码关键推理节点之后,答案概率分布发生明显偏移,掩码后的橙色分布整体向高值方向移动,说明屏蔽推理路径上的因果节点后,模型原本正确答案的生成概率显著下降,较高的(D_{KS})和极小的 p 值证明两组分布具备统计学层面的显著差异,该结果在从小参数量到大参数量的多款模型上都能复现,以此证明 CCG 定义的 R-path 节点确实是影响模型生成答案的因果中介,模型的数学推理依赖该因果结构,而不是无关联的文本特征。

实验

该表格展示多款不同架构与参数量的大模型,在 GSM8K、MATH500、AIME 三套数学数据集上完成注意力抑制实验的汇总结果,表格对比原始推理条件和对 CCG 推理节点做注意力抑制这两种场景下,模型答案的不确定性指标,同时给出两组指标分布之间的 KS 检验距离,实验发现针对推理图中推理节点对应的 token 进行注意力抑制操作后,模型输出答案的不确定性会明显变大,两组分布存在高度显著的统计学差异,以此验证论文核心假设,即 CCG 所提取出的推理节点,是连接题目输入和最终答案的因果中介,抑制这类节点的注意力会直接干扰模型的数学推理过程。


【声明】内容源于网络
0
0
AI科研进阶社
感谢关注AI科研进阶社!人工智能学习资料、机器学习&深度学习基础干货、论文写作资源等都在这里!
内容 179
粉丝 0
AI科研进阶社 感谢关注AI科研进阶社!人工智能学习资料、机器学习&深度学习基础干货、论文写作资源等都在这里!
总阅读3.1k
粉丝0
内容179