本文作者|倪赞林 等
本文编辑|张意梅
ICML 2026 杰出论文
论文题目:The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models
论文作者:Zanlin Ni, Shenzhi Wang, Yang Yue, Tianyu Yu, Weilin Zhao, Yeguo Hua, Tianyi Chen, Jun Song, Cheng Yu, Bo Zheng, Gao Huang
项目主页:https://nzl-thu.github.io/the-flexibility-trap
论文代码:https://github.com/LeapLabTHU/JustGRPO
开篇:扩散语言模型最受推崇的特性,可能是一个陷阱
近年来,扩散语言模型(dLLMs)如 LLaDA、Dream、Mercury 等相继问世。其核心优势通常被归纳为两点:并行解码带来的推理加速,以及任意顺序生成(arbitrary-order generation)。
直觉上,任意顺序生成允许模型像做填空题一样,先确定有把握的部分再补全不确定位置,理论上解空间应大于传统自回归(AR)模型。然而,清华大学 LeapLab 的这篇 ICML 2026 杰出论文得出了反直觉的结论:在数学和代码等通用推理任务上,任意顺序生成非但没有扩展推理边界,反而通过“绕过不确定性”压缩了有效解空间。
图注:限制 dLLM 使用标准 AR 顺序,反而拥有更高的推理上限。JustGRPO 放弃任意顺序适配,直接使用 GRPO,表现优于各类基线方法。
第一个反直觉发现:选择越多,表现反而越差
研究引入 Pass@k 指标衡量模型在 k 次尝试内的解题潜力。实验对比了两种解码模式:任意顺序(模型动态选择置信度高的位置)与 AR 顺序(强制从左到右生成)。
结果显示,单次作答时两者差异不大,但随着尝试次数 k 增加,AR 顺序能挖掘出更多正确解。在 Pass@1024 的极限测试下,任意顺序可解的题目集合几乎完全是 AR 顺序的子集。进一步扫描半自回归的 block size 发现,解码顺序越灵活,模型的推理潜力越低,这是一个连续且单调下降的趋势。
图注:Pass@k 对比。随着 k 增大,AR 顺序曲线攀升更快、上限更高。该规律在多个模型及 GSM8K、MATH-500 等基准上一致成立。
图注:Pass@1024 下的解空间覆盖。任意顺序能解的题,基本上是 AR 的子集。
第二个关键发现:模型并非“不会做”,而是在回避决策
为何会出现这种现象?研究聚焦于推理链中的“逻辑分叉词”(如 Therefore, However 等)。这些词对应多条可能的推理路径,保持其高熵状态对探索解空间至关重要。
AR 顺序迫使模型在分叉点当场作出选择,多次采样自然覆盖不同路径。而任意顺序采取“回避”策略:当遇到低置信度的分叉词时,模型会跳过该位置,先生成后续确定性高的 token。待后文铺就后再回来填空时,上下文已将答案“锁死”,导致分叉词只能填入与后文兼容的选项,失去了分支多样性。
作者将这一现象命名为“熵退化”(Entropy Degradation):灵活性被模型利用为一种局部贪婪优化策略,导致解空间多样性过早坍缩。灵活性本应服务于探索(exploration),实际上却鼓励了利用(exploitation)。
图注:(a) AR 顺序迫使模型直面决策;(b) 任意顺序绕过不确定性,导致分叉词处熵显著坍塌。
既然如此,复杂的 RL 算法付出了哪些代价
现有 dLLM 强化学习方法(如 d1、ESPO 等)大多默认必须保留任意顺序的灵活性,这带来了三重代价:Token 级概率无法良定义、序列似然不可精确求解(需 ELBO 近似)、采样器与优化目标不一致(off-policy 错位)。
如果任意顺序在通用推理任务中本身有害或不必要,那么上述复杂性便是在为一个错误的特性支付高昂代价。
JustGRPO:一个极为简洁的解法
基于上述洞察,作者提出 JustGRPO,其核心设计极为简洁:
- RL 训练阶段视为自回归模型:每一步只解码最左侧的 mask token,构造标准的从左到右生成轨迹;
- 直接套用标准 GRPO 算法:无需 ELBO 近似,无需处理组合爆炸,Token 概率精确且位置对齐;
- 推理阶段架构不变:不引入 causal mask,保留双向注意力与离散扩散公式,并行解码照常使用。
AR 约束仅是训练阶段的“脚手架”。模型学到的并非“只能从左到右生成”,而是“在分叉点敢于探索多条路径”。一旦这种能力内化,无论采用何种顺序解码,模型都能受益。
实验结果:简洁方法取得优秀表现
实验显示,JustGRPO 在 GSM8K、MATH-500、HumanEval、MBPP 等基准上全面超越 d1、ESPO、GDPO 等专为扩散模型设计的复杂 RL 方法。值得注意的是,JustGRPO 未依赖额外可训练模块或大规模私有数据。
在并行解码方面,JustGRPO 不仅保留了并行能力,且在高并行度下增益更明显。这是因为 AR 训练使模型学到了更鲁棒的联合分布,对并行采样中的近似误差更具韧性。
图注:JustGRPO 在主基准上的表现优于各类 diffusion-specific RL 方法。
图注:随着每步并行 token 数增加,JustGRPO 相对基座模型的增益反而扩大。
如果只记住三件事
一、更大的解空间,不等于更强的推理能力。
理论上的超集不代表实际采样的有效性。任意顺序在真实解码机制下,可解题目反而收缩成了 AR 的子集。
二、给模型选择的自由,它会用来回避困难。
任意顺序的 confidence-based decoding 本质上是一种推理时的 exploitation。模型利用灵活性跳过艰难决策点,导致解空间多样性过早坍缩。
三、技术复杂度攀升时,值得回头检查前提。
JustGRPO 通过做减法(移除复杂性,回归朴素 GRPO)取得了更好效果。这说明此前的许多复杂设计,可能只是在维护一个未经验证的前提。
写在最后
一个特性在理论上“能做”,并不意味着在实践中“该做”。任意顺序生成在约束满足任务上或有独到之处,但在需要长链推理的数学和代码任务上,“先做简单的、再回头补全”的策略恰恰扼杀了推理过程中最宝贵的东西——在不确定性中作出选择的能力。
归根结底,推理不是一道填空题,而是一道选择题。关键在于站在分叉路口时,是否真正面对过那些可能性。
ICML 委员会评语

