大数跨境

ICML 2026 杰出论文 | 选择越多反而越差?清华这篇论文颠覆了扩散语言模型的认知

ICML 2026 杰出论文 | 选择越多反而越差?清华这篇论文颠覆了扩散语言模型的认知 AI TIME 论道
2026-07-28
3
导读:一个特性在理论上"能做",并不意味着在实践中"该做"。

本文作者|倪赞林 等

本文编辑|张意梅

ICML 2026 杰出论文

  • 论文题目:The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models

  • 论文作者:Zanlin Ni, Shenzhi Wang, Yang Yue, Tianyu Yu, Weilin Zhao, Yeguo Hua, Tianyi Chen, Jun Song, Cheng Yu, Bo Zheng, Gao Huang

  • 项目主页:https://nzl-thu.github.io/the-flexibility-trap

  • 论文代码:https://github.com/LeapLabTHU/JustGRPO

开篇:扩散语言模型最受推崇的特性,可能是一个陷阱

近年来,扩散语言模型(dLLMs)如 LLaDA、Dream、Mercury、Gemini Diffusion 等相继问世。其核心优势通常被归结为两点:并行解码带来的推理加速,以及任意顺序生成(arbitrary-order generation)。

直觉上,任意顺序生成允许模型像做填空题一样,先确定有把握的部分再补全不确定位置,理论上解空间更大,推理能力应更强。然而,清华大学 LeapLab 的最新研究得出了反直觉的结论:在数学和代码等通用推理任务上,任意顺序生成非但没有扩展推理边界,反而通过“绕过不确定性”压缩了有效的解空间。

更少的灵活性却带来更强推理。左图:限制 dLLM 使用标准 AR 顺序,反而拥有更高的推理上限。右图:JustGRPO 与 d1、ESPO、SPG、GDPO 等基线方法的对比——放弃任意顺序适配,直接使用 GRPO。

第一个反直觉发现:选择越多,表现反而越差

研究引入了 Pass@k 指标来衡量模型的推理潜力上限。作者对比了同一扩散语言模型在两种解码模式下的表现:任意顺序(Arbitrary Order,dLLM 标准方式)与 AR 顺序(强制从左到右生成)。

实验结果显示,单次作答时两者差别不大,但随着尝试次数 k 增加,AR 顺序能挖掘出更多正确解,其 Pass@k 曲线攀升更快、上限更高。这一规律在多个模型及 GSM8K、MATH-500、HumanEval、MBPP 等基准上一致成立。

Pass@k 对比。随着 k 增大,AR 顺序的曲线攀升更快、上限更高。

进一步的解空间覆盖实验表明,理论上作为超集的任意顺序,在实践中可解的题目几乎只是 AR 顺序的子集。例如在 HumanEval 上,21.3% 的题目只有 AR 顺序能解,而仅 0.6% 是任意顺序独有的。随着生成顺序自由度(block size B)的增加,Pass@k 呈单调下降趋势,证明解码顺序越灵活,模型的推理潜力越低。

Pass@1024 下的解空间覆盖。任意顺序(AO)能解的题,基本上是 AR 的子集。

第二个关键发现:模型并非“不会做”,而是在回避决策

为何会出现这种现象?作者将目光投向推理链中的“逻辑分叉词”(如 Therefore, However, Since 等)。这些词决定了推理方向,天然具有高熵。

AR 顺序迫使模型在分叉点直面决策,多次采样能自然覆盖多条推理路径。而任意顺序则倾向于“回避”:当模型对某位置置信度低时,会跳过该位置先生成后续确定的 token,待上下文铺就后再回来补全。此时,分叉词不再意味着“选择”,而变成了顺应后文的“填空”,导致逻辑分支多样性过早坍缩。

(a) AR 顺序迫使模型在不确定 token 处直面决策。(b) 任意顺序绕过不确定性,等回来填分叉词时,未来上下文已经把答案“锁死”了。

作者将这一现象命名为“熵退化(Entropy Degradation)”:任意顺序带来的灵活性被模型利用为一种“局部贪婪优化”策略。灵活性本应服务于探索(exploration),实际上却鼓励了利用(exploitation),导致解空间多样性丧失。

复杂 RL 算法的代价与 JustGRPO 的简洁解法

现有 dLLM 强化学习方法(如 d1、ESPO 等)为保留任意顺序灵活性,付出了巨大代价:Token 级概率无法良定义、序列似然需近似求解、采样器与优化目标不一致。如果任意顺序本身有害,这些复杂性便是在为错误的前提买单。

基于此,作者提出了 JustGRPO,其核心思想极为简洁:

  1. RL 训练阶段视为自回归模型:每一步只解码最左侧 mask token,构造标准从左到右轨迹。
  2. 直接套用标准 GRPO 算法:无需 ELBO 近似或处理组合爆炸,Token 概率精确且位置对齐。
  3. 推理阶段架构不变:不引入 causal mask,保留双向注意力与并行解码能力。

AR 约束仅是训练阶段的“脚手架”,旨在让模型学会在分叉点敢于探索。一旦能力内化,模型在任意解码顺序下均能受益。

实验结果:简洁方法取得优秀表现

实验显示,JustGRPO 在 GSM8K、MATH-500、HumanEval、MBPP 等基准上全面超越 d1、ESPO、GDPO、SPG 等专用扩散 RL 方法。值得注意的是,JustGRPO 未依赖额外可训练模块或大规模私有数据。

在并行解码方面,JustGRPO 不仅保留了原有能力,且在高并行度下增益更大。这表明 AR 训练使模型学到了更鲁棒的联合分布,对并行采样中的近似误差更具韧性。

JustGRPO 在 LLaDA-Instruct 上的主结果,超越各类 diffusion-specific RL 方法。

核心洞察与总结

本研究带来了三个关键判断:

一、更大的解空间不等于更强的推理能力。理论上的可达性与实际采样的有效性存在差距,采样行为往往才是决定性的。

二、给模型选择的自由,它可能用来回避困难。任意顺序下的置信度解码本质上是一种推理时的 exploitation,导致模型跳过艰难决策点,过早坍缩解空间多样性。

三、技术复杂度攀升时需回头检查前提。JustGRPO 通过做减法,移除不必要的复杂性,回归朴素 GRPO,反而取得了更好效果,说明许多精巧设计可能是在维护一个未经验证的前提。

写在最后

从宏观视角看,一个特性在理论上“能做”并不意味着实践中“该做”。任意顺序生成在约束满足任务上或有独到之处,但在需要长链推理的任务上,“先做简单的、再回头补全”的策略恰恰扼杀了在不确定性中作出选择的能力。推理不是一道填空题,而是一道选择题,关键在于是否真正面对过分叉路口的可能性。

ICML 委员会评语

2026 年 7 月 5 日,ICML 2026 公布年度奖项,这篇论文获得杰出论文奖(Outstanding Paper Award)。本届会议共收到 24,661 篇有效投稿,最终仅两篇论文获此奖项。

“在扩散语言模型正逐步确立其作为语言生成中自回归范式有力竞争者的背景下,这篇论文提出了一个令人耳目一新的反直觉观点,挑战了该领域的一个主流假设。任意顺序生成常被视为 dLLM 得以更快生成的主要特性,而作者令人信服地表明:在通用推理任务上,dLLM 恰恰利用这种自由绕开了最关键的高不确定性'分叉'token,导致解的多样性坍缩。这是一种非显然的失效模式。基于这一洞察,作者提出重新审视 dLLM 的后训练:在强化学习 rollout 中改用更简单的固定从左到右生成顺序(即 JustGRPO),同时在推理阶段保留并行解码。”

                              ——ICML 2026 评委会

点击 阅读原文 观看作者直播回放!

【声明】内容源于网络
0
0
AI TIME 论道
AI TIME是一群关注人工智能发展,并有思想情怀的青年学者创办的圈子,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,链接全球AI学者,以辩论的形式探讨人工智能领域的未来
内容 2182
粉丝 0
AI TIME 论道 AI TIME是一群关注人工智能发展,并有思想情怀的青年学者创办的圈子,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,链接全球AI学者,以辩论的形式探讨人工智能领域的未来
总阅读46.2k
粉丝0
内容2.2k