本文作者|倪赞林 等
本文编辑|张意梅
ICML 2026 杰出论文
论文题目:The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models
论文作者:Zanlin Ni, Shenzhi Wang, Yang Yue, Tianyu Yu, Weilin Zhao, Yeguo Hua, Tianyi Chen, Jun Song, Cheng Yu, Bo Zheng, Gao Huang
项目主页:https://nzl-thu.github.io/the-flexibility-trap
论文代码:https://github.com/LeapLabTHU/JustGRPO
开篇:扩散语言模型最受推崇的特性,可能是一个陷阱
近年来,扩散语言模型(dLLMs)如 LLaDA、Dream、Mercury、Gemini Diffusion 等相继问世。其核心优势通常被归结为两点:并行解码带来的推理加速,以及任意顺序生成(arbitrary-order generation)。
直觉上,任意顺序生成允许模型像做填空题一样,先确定有把握的部分再补全不确定位置,理论上解空间更大,推理能力应更强。然而,清华大学 LeapLab 的最新研究得出了反直觉的结论:在数学和代码等通用推理任务上,任意顺序生成非但没有扩展推理边界,反而通过“绕过不确定性”压缩了有效的解空间。
更少的灵活性却带来更强推理。左图:限制 dLLM 使用标准 AR 顺序,反而拥有更高的推理上限。右图:JustGRPO 与 d1、ESPO、SPG、GDPO 等基线方法的对比——放弃任意顺序适配,直接使用 GRPO。
第一个反直觉发现:选择越多,表现反而越差
研究引入了 Pass@k 指标来衡量模型的推理潜力上限。作者对比了同一扩散语言模型在两种解码模式下的表现:任意顺序(Arbitrary Order,dLLM 标准方式)与 AR 顺序(强制从左到右生成)。
实验结果显示,单次作答时两者差别不大,但随着尝试次数 k 增加,AR 顺序能挖掘出更多正确解,其 Pass@k 曲线攀升更快、上限更高。这一规律在多个模型及 GSM8K、MATH-500、HumanEval、MBPP 等基准上一致成立。
Pass@k 对比。随着 k 增大,AR 顺序的曲线攀升更快、上限更高。
进一步的解空间覆盖实验表明,理论上作为超集的任意顺序,在实践中可解的题目几乎只是 AR 顺序的子集。例如在 HumanEval 上,21.3% 的题目只有 AR 顺序能解,而仅 0.6% 是任意顺序独有的。随着生成顺序自由度(block size B)的增加,Pass@k 呈单调下降趋势,证明解码顺序越灵活,模型的推理潜力越低。
Pass@1024 下的解空间覆盖。任意顺序(AO)能解的题,基本上是 AR 的子集。
第二个关键发现:模型并非“不会做”,而是在回避决策
为何会出现这种现象?作者将目光投向推理链中的“逻辑分叉词”(如 Therefore, However, Since 等)。这些词决定了推理方向,天然具有高熵。
AR 顺序迫使模型在分叉点直面决策,多次采样能自然覆盖多条推理路径。而任意顺序则倾向于“回避”:当模型对某位置置信度低时,会跳过该位置先生成后续确定的 token,待上下文铺就后再回来补全。此时,分叉词不再意味着“选择”,而变成了顺应后文的“填空”,导致逻辑分支多样性过早坍缩。
(a) AR 顺序迫使模型在不确定 token 处直面决策。(b) 任意顺序绕过不确定性,等回来填分叉词时,未来上下文已经把答案“锁死”了。
作者将这一现象命名为“熵退化(Entropy Degradation)”:任意顺序带来的灵活性被模型利用为一种“局部贪婪优化”策略。灵活性本应服务于探索(exploration),实际上却鼓励了利用(exploitation),导致解空间多样性丧失。
复杂 RL 算法的代价与 JustGRPO 的简洁解法
现有 dLLM 强化学习方法(如 d1、ESPO 等)为保留任意顺序灵活性,付出了巨大代价:Token 级概率无法良定义、序列似然需近似求解、采样器与优化目标不一致。如果任意顺序本身有害,这些复杂性便是在为错误的前提买单。
基于此,作者提出了 JustGRPO,其核心思想极为简洁:
- RL 训练阶段视为自回归模型:每一步只解码最左侧 mask token,构造标准从左到右轨迹。
- 直接套用标准 GRPO 算法:无需 ELBO 近似或处理组合爆炸,Token 概率精确且位置对齐。
- 推理阶段架构不变:不引入 causal mask,保留双向注意力与并行解码能力。
AR 约束仅是训练阶段的“脚手架”,旨在让模型学会在分叉点敢于探索。一旦能力内化,模型在任意解码顺序下均能受益。
实验结果:简洁方法取得优秀表现
实验显示,JustGRPO 在 GSM8K、MATH-500、HumanEval、MBPP 等基准上全面超越 d1、ESPO、GDPO、SPG 等专用扩散 RL 方法。值得注意的是,JustGRPO 未依赖额外可训练模块或大规模私有数据。
在并行解码方面,JustGRPO 不仅保留了原有能力,且在高并行度下增益更大。这表明 AR 训练使模型学到了更鲁棒的联合分布,对并行采样中的近似误差更具韧性。
JustGRPO 在 LLaDA-Instruct 上的主结果,超越各类 diffusion-specific RL 方法。
核心洞察与总结
本研究带来了三个关键判断:
一、更大的解空间不等于更强的推理能力。理论上的可达性与实际采样的有效性存在差距,采样行为往往才是决定性的。
二、给模型选择的自由,它可能用来回避困难。任意顺序下的置信度解码本质上是一种推理时的 exploitation,导致模型跳过艰难决策点,过早坍缩解空间多样性。
三、技术复杂度攀升时需回头检查前提。JustGRPO 通过做减法,移除不必要的复杂性,回归朴素 GRPO,反而取得了更好效果,说明许多精巧设计可能是在维护一个未经验证的前提。
写在最后
从宏观视角看,一个特性在理论上“能做”并不意味着实践中“该做”。任意顺序生成在约束满足任务上或有独到之处,但在需要长链推理的任务上,“先做简单的、再回头补全”的策略恰恰扼杀了在不确定性中作出选择的能力。推理不是一道填空题,而是一道选择题,关键在于是否真正面对过分叉路口的可能性。
ICML 委员会评语
点击 阅读原文 观看作者直播回放!

