大数跨境

唐杰新作!不改模型不做训练,GLM-5.2长上下文推理精确匹配率飙到100%

唐杰新作!不改模型不做训练,GLM-5.2长上下文推理精确匹配率飙到100% 智猩猩AI
2026-09-11
11
导读:用Reasoning Trace重构长上下文推理~
智猩猩AI整理
编辑:没方

如今的大模型已经可以处理几十万甚至上百万 Token 的上下文,但上下文窗口变长,并不等于模型能够真正利用好这些信息。


一个核心问题来自 Transformer 的因果注意力机制,模型在一次前向处理中,只能让后面的 Token 看到前面的内容,而后面才出现的信息,无法反过来改变前面 Token 已经形成的表示。


这在长上下文推理中尤其麻烦。因为模型真正需要维护的“任务状态”,比如当前搜索目标、已经排除的假设、图搜索前沿,往往是在读完整段上下文甚至开始推理之后才逐渐确定。


针对这一问题,智谱唐杰团队提出了一种非常简单的推理时扩展方法 TRACE AS STATE

它的核心思路不是改模型架构,也不重新训练模型,而是让模型先完整处理一次任务,拿到第一轮产生的 reasoning traces,也就是推理轨迹。随后把这些轨迹当成一种“任务状态代理”,放到原始长上下文前面,让模型重新读一遍上下文。


研究团队还设计了一个严格对照方法 TRACE APPEND,使用完全相同的 reasoning traces,但把它们放在长上下文后面


以 GraphWalks Parents 任务为例,DeepSeek V4 Pro(Preview)的精确匹配率(EM)从首次推理的 29.2%、使用 TRACE APPEND 时的 43.0%,提升到 TRACE AS STATE 下的 81.8%GLM-5.2 则从首次推理的 66.4%、TRACE APPEND 的 83.2%,进一步提升至 100.0%


这些结果表明,在不改变因果 Transformer 结构的前提下,将推理轨迹放在长上下文之前,可以显著改善模型的长上下文推理能力。


01

TRACE AS STATE 是怎么做的?


研究团队首先构造了一个 Conditional State Update,条件状态更新问题。


假设系统需要依次读取一系列信息 C = (c₁, c₂, …, cₙ)。系统内部维护一个状态  sᵢ,每读到一条新信息,就按照固定规则更新 sᵢ = U(sᵢ₋₁, cᵢ)


其中,初始状态  s₀ 由一个条件  z  决定。


此时存在两种读取顺序。


第一种是[ z , C ], 也就是先知道任务条件,再开始读信息。


这种情况下,系统从一开始就知道自己到底应该追踪哪条状态路径,因此只需要保存当前状态  sᵢ。如果状态空间为  S ,令 b=log2|S|,理论上只需要大约  b bit 工作内存。


但如果顺序反过来 [ C , z ], 系统必须先读完整个信息序列,最后才知道真正的初始条件是什么。


问题就来了,在不知道  z  的情况下,系统必须考虑“对于所有可能的  z ,这串信息最终会把状态变成什么”。


研究团队证明,在最坏情况下,这时系统需要维护多达 |S||S| 种不同可能,对应的内存需求达到:



相比条件提前出现时的  b  bit,内存需求呈指数级增长


当然,研究团队也特别强调,这并不是说真实 Transformer 在实际任务中一定存在指数级性能差距。这个理论模型更多是在说明,对于因果模型,如果某个任务状态能够提前获得,那么它就可以在读取后续信息的过程中持续发挥作用。


02

把 reasoning trace 当成“任务状态” 


但现实中的问题是,模型不可能在一开始就知道完整的任务状态。很多状态恰恰是模型第一次读完长上下文、开始推理之后才发现的。


因此研究团队提出,可以把模型自己的 reasoning trace 看成一种可观察的文本状态代理


这里研究团队非常谨慎,reasoning trace 并不等同于模型真正的内部状态,它可能是不完整的、有损的,甚至是错误的。


但只要其中包含了一部分与任务有关的有效信息,就可能在第二遍阅读上下文时提供帮助。


具体来说,对于同一个长上下文 x,模型首先运行 nₜᵣ 次,每次得到一条 reasoning trace rⱼ 和最终答案 aⱼ。


随后,通过一个固定的序列化器 π,把多条 reasoning trace 按原始顺序拼接成:


实验中,序列化器本身几乎不做加工,只添加固定标签和分隔符。


03

Trace 放在哪里?


TRACE APPEND设计是第二轮输入顺序为 [x,T,q] ,也就是:原始长上下文 → reasoning trace → 问题


此时 reasoning trace 的确可以帮助第二轮最终推理和作答,但它出现得太晚,无法影响模型此前处理长上下文时已经形成的表示。


最核心 TRACE AS STATE 的设计,则将顺序改成 [T,x,q] ,即:reasoning trace → 原始长上下文 → 问题


这样一来,模型在第二次阅读整个长上下文时,从一开始就已经拿到了上一轮推理过程中发现的任务状态。


下图所展示的核心其实就是这一步,第一次 pass 负责“发现状态”,第二次 pass 把这些状态移到上下文前方,再重新处理原始信息。



TRACE AS STATE 和 TRACE APPEND 使用同一个模型、同一个原始上下文、同一批 reasoning traces。唯一变量就是 Trace 的位置。


因此能够比较提升究竟来自“多看了一遍推理轨迹”,还是来自“让任务状态提前参与上下文处理”。


04

对比实验与结果分析


主要实验结果如表2所示,在 27 个“模型 × 任务 × 指标”组合中,TRACE AS STATE 有 26 项得分高于 TRACE APPEND。



对于 DeepSeek V4 Pro 和 Qwen 3.7 Max,TRACE AS STATE 在所有报告的数据集、任务和评估指标上都优于 TRACE APPEND。


GLM-5.2 的结果也基本遵循这一规律,唯一的例外出现在 GraphWalks 的 BFS F1 指标上,TRACE APPEND 比 TRACE AS STATE 高 0.8 分。不过在同一任务的精确匹配率(EM)上,TRACE AS STATE 仍然更高。


此外,在所有报告的评测中,TRACE AS STATE 的表现都超过了第一轮推理(First Pass)


TRACE APPEND 在不少实验设置中也比 First Pass 表现更好,这说明推理轨迹文本本身确实携带了有用的信息


而 TRACE AS STATE 在此基础上取得的进一步优势,与研究团队的假设一致,将 reasoning trace 作为一种不完美的“文本任务状态代理”,放到长上下文之前,可以让模型在重新处理上下文时更有效地利用这些状态信息。


最明显的提升出现在 GraphWalks Parents 任务上。该任务要求模型在理解图结构的过程中持续维护前驱节点状态。


DeepSeek V4 Pro 的 F1 从 46.5 提升到 91.3,EM 则从 29.2 提升到 81.8;Qwen 3.7 Max 的 F1 从 87.2 提升到 99.1,EM 从 60.8 提升到 96.4


在 TRACE AS STATE 设置下,GLM-5.2 在 Parents 任务上的 EM 和 F1 均达到 100.0


MRCRv2 的检索与信息绑定实验也表现出相同的顺序优势,将推理轨迹放在上下文之前效果更好。NUB-1M 的实验则进一步提供了同方向的证据,表明这种方法同样有助于超长小说的细粒度阅读理解

END


关注+星标,获取AI前沿进展与开源一线动态

【声明】内容源于网络
0
0
智猩猩AI
智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
内容 2347
粉丝 0
智猩猩AI 智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
总阅读3.1k
粉丝0
内容2.3k