如今的大模型已经可以处理几十万甚至上百万 Token 的上下文,但上下文窗口变长,并不等于模型能够真正利用好这些信息。
一个核心问题来自 Transformer 的因果注意力机制,模型在一次前向处理中,只能让后面的 Token 看到前面的内容,而后面才出现的信息,无法反过来改变前面 Token 已经形成的表示。
这在长上下文推理中尤其麻烦。因为模型真正需要维护的“任务状态”,比如当前搜索目标、已经排除的假设、图搜索前沿,往往是在读完整段上下文甚至开始推理之后才逐渐确定。
针对这一问题,智谱唐杰团队提出了一种非常简单的推理时扩展方法 TRACE AS STATE。
它的核心思路不是改模型架构,也不重新训练模型,而是让模型先完整处理一次任务,拿到第一轮产生的 reasoning traces,也就是推理轨迹。随后把这些轨迹当成一种“任务状态代理”,放到原始长上下文前面,让模型重新读一遍上下文。
研究团队还设计了一个严格对照方法 TRACE APPEND,使用完全相同的 reasoning traces,但把它们放在长上下文后面。
以 GraphWalks Parents 任务为例,DeepSeek V4 Pro(Preview)的精确匹配率(EM)从首次推理的 29.2%、使用 TRACE APPEND 时的 43.0%,提升到 TRACE AS STATE 下的 81.8%;GLM-5.2 则从首次推理的 66.4%、TRACE APPEND 的 83.2%,进一步提升至 100.0%。
这些结果表明,在不改变因果 Transformer 结构的前提下,将推理轨迹放在长上下文之前,可以显著改善模型的长上下文推理能力。
01
TRACE AS STATE 是怎么做的?
研究团队首先构造了一个 Conditional State Update,条件状态更新问题。
假设系统需要依次读取一系列信息 C = (c₁, c₂, …, cₙ)。系统内部维护一个状态
其中,初始状态
此时存在两种读取顺序。
第一种是[
这种情况下,系统从一开始就知道自己到底应该追踪哪条状态路径,因此只需要保存当前状态
但如果顺序反过来 [
问题就来了,在不知道
研究团队证明,在最坏情况下,这时系统需要维护多达 |S||S| 种不同可能,对应的内存需求达到:
相比条件提前出现时的
当然,研究团队也特别强调,这并不是说真实 Transformer 在实际任务中一定存在指数级性能差距。这个理论模型更多是在说明,对于因果模型,如果某个任务状态能够提前获得,那么它就可以在读取后续信息的过程中持续发挥作用。
02
把 reasoning trace 当成“任务状态”
但现实中的问题是,模型不可能在一开始就知道完整的任务状态。很多状态恰恰是模型第一次读完长上下文、开始推理之后才发现的。
因此研究团队提出,可以把模型自己的 reasoning trace 看成一种可观察的文本状态代理。
这里研究团队非常谨慎,reasoning trace 并不等同于模型真正的内部状态,它可能是不完整的、有损的,甚至是错误的。
但只要其中包含了一部分与任务有关的有效信息,就可能在第二遍阅读上下文时提供帮助。
具体来说,对于同一个长上下文 x,模型首先运行 nₜᵣ 次,每次得到一条 reasoning trace rⱼ 和最终答案 aⱼ。
随后,通过一个固定的序列化器 π,把多条 reasoning trace 按原始顺序拼接成:
实验中,序列化器本身几乎不做加工,只添加固定标签和分隔符。
03
Trace 放在哪里?
TRACE APPEND设计是第二轮输入顺序为 [x,T,q] ,也就是:原始长上下文 → reasoning trace → 问题
此时 reasoning trace 的确可以帮助第二轮最终推理和作答,但它出现得太晚,无法影响模型此前处理长上下文时已经形成的表示。
最核心 TRACE AS STATE 的设计,则将顺序改成 [T,x,q] ,即:reasoning trace → 原始长上下文 → 问题
这样一来,模型在第二次阅读整个长上下文时,从一开始就已经拿到了上一轮推理过程中发现的任务状态。
下图所展示的核心其实就是这一步,第一次 pass 负责“发现状态”,第二次 pass 把这些状态移到上下文前方,再重新处理原始信息。
TRACE AS STATE 和 TRACE APPEND 使用同一个模型、同一个原始上下文、同一批 reasoning traces。唯一变量就是 Trace 的位置。
因此能够比较提升究竟来自“多看了一遍推理轨迹”,还是来自“让任务状态提前参与上下文处理”。
04
对比实验与结果分析
主要实验结果如表2所示,在 27 个“模型 × 任务 × 指标”组合中,TRACE AS STATE 有 26 项得分高于 TRACE APPEND。
对于 DeepSeek V4 Pro 和 Qwen 3.7 Max,TRACE AS STATE 在所有报告的数据集、任务和评估指标上都优于 TRACE APPEND。
GLM-5.2 的结果也基本遵循这一规律,唯一的例外出现在 GraphWalks 的 BFS F1 指标上,TRACE APPEND 比 TRACE AS STATE 高 0.8 分。不过在同一任务的精确匹配率(EM)上,TRACE AS STATE 仍然更高。
此外,在所有报告的评测中,TRACE AS STATE 的表现都超过了第一轮推理(First Pass)。
TRACE APPEND 在不少实验设置中也比 First Pass 表现更好,这说明推理轨迹文本本身确实携带了有用的信息。
而 TRACE AS STATE 在此基础上取得的进一步优势,与研究团队的假设一致,将 reasoning trace 作为一种不完美的“文本任务状态代理”,放到长上下文之前,可以让模型在重新处理上下文时更有效地利用这些状态信息。
最明显的提升出现在 GraphWalks Parents 任务上。该任务要求模型在理解图结构的过程中持续维护前驱节点状态。
DeepSeek V4 Pro 的 F1 从 46.5 提升到 91.3,EM 则从 29.2 提升到 81.8;Qwen 3.7 Max 的 F1 从 87.2 提升到 99.1,EM 从 60.8 提升到 96.4。
在 TRACE AS STATE 设置下,GLM-5.2 在 Parents 任务上的 EM 和 F1 均达到 100.0。
MRCRv2 的检索与信息绑定实验也表现出相同的顺序优势,将推理轨迹放在上下文之前效果更好。NUB-1M 的实验则进一步提供了同方向的证据,表明这种方法同样有助于超长小说的细粒度阅读理解。
END
关注+星标,获取AI前沿进展与开源一线动态

