大数跨境

ICML 2026 杰出论文 | 选择越多反而越差?清华这篇论文颠覆了扩散语言模型的认知

ICML 2026 杰出论文 | 选择越多反而越差?清华这篇论文颠覆了扩散语言模型的认知 AI TIME 论道
2026-07-28
6
导读:一个特性在理论上"能做",并不意味着在实践中"该做"。

本文作者|倪赞林 等

本文编辑|张意梅


ICML 2026 杰出论文

  • 论文题目:The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models

  • 论文作者:Zanlin Ni, Shenzhi Wang, Yang Yue, Tianyu Yu, Weilin Zhao, Yeguo Hua, Tianyi Chen, Jun Song, Cheng Yu, Bo Zheng, Gao Huang

  • 项目主页:https://nzl-thu.github.io/the-flexibility-trap

  • 论文代码:https://github.com/LeapLabTHU/JustGRPO

开篇:扩散语言模型最受推崇的特性,可能是一个陷阱

近年来,扩散语言模型(dLLMs)如 LLaDA、Dream、Mercury 等相继问世。其核心优势通常被归纳为两点:并行解码带来的推理加速,以及任意顺序生成(arbitrary-order generation)。

直觉上,任意顺序生成允许模型像做填空题一样,先确定有把握的部分再补全不确定位置,理论上解空间应大于传统自回归(AR)模型。然而,清华大学 LeapLab 的这篇 ICML 2026 杰出论文得出了反直觉的结论:在数学和代码等通用推理任务上,任意顺序生成非但没有扩展推理边界,反而通过“绕过不确定性”压缩了有效解空间。

图注:限制 dLLM 使用标准 AR 顺序,反而拥有更高的推理上限。JustGRPO 放弃任意顺序适配,直接使用 GRPO,表现优于各类基线方法。

第一个反直觉发现:选择越多,表现反而越差

研究引入 Pass@k 指标衡量模型在 k 次尝试内的解题潜力。实验对比了两种解码模式:任意顺序(模型动态选择置信度高的位置)与 AR 顺序(强制从左到右生成)。

结果显示,单次作答时两者差异不大,但随着尝试次数 k 增加,AR 顺序能挖掘出更多正确解。在 Pass@1024 的极限测试下,任意顺序可解的题目集合几乎完全是 AR 顺序的子集。进一步扫描半自回归的 block size 发现,解码顺序越灵活,模型的推理潜力越低,这是一个连续且单调下降的趋势。

图注:Pass@k 对比。随着 k 增大,AR 顺序曲线攀升更快、上限更高。该规律在多个模型及 GSM8K、MATH-500 等基准上一致成立。

图注:Pass@1024 下的解空间覆盖。任意顺序能解的题,基本上是 AR 的子集。

第二个关键发现:模型并非“不会做”,而是在回避决策

为何会出现这种现象?研究聚焦于推理链中的“逻辑分叉词”(如 Therefore, However 等)。这些词对应多条可能的推理路径,保持其高熵状态对探索解空间至关重要。

AR 顺序迫使模型在分叉点当场作出选择,多次采样自然覆盖不同路径。而任意顺序采取“回避”策略:当遇到低置信度的分叉词时,模型会跳过该位置,先生成后续确定性高的 token。待后文铺就后再回来填空时,上下文已将答案“锁死”,导致分叉词只能填入与后文兼容的选项,失去了分支多样性。

作者将这一现象命名为“熵退化”(Entropy Degradation):灵活性被模型利用为一种局部贪婪优化策略,导致解空间多样性过早坍缩。灵活性本应服务于探索(exploration),实际上却鼓励了利用(exploitation)。

图注:(a) AR 顺序迫使模型直面决策;(b) 任意顺序绕过不确定性,导致分叉词处熵显著坍塌。

既然如此,复杂的 RL 算法付出了哪些代价

现有 dLLM 强化学习方法(如 d1、ESPO 等)大多默认必须保留任意顺序的灵活性,这带来了三重代价:Token 级概率无法良定义、序列似然不可精确求解(需 ELBO 近似)、采样器与优化目标不一致(off-policy 错位)。

如果任意顺序在通用推理任务中本身有害或不必要,那么上述复杂性便是在为一个错误的特性支付高昂代价。

JustGRPO:一个极为简洁的解法

基于上述洞察,作者提出 JustGRPO,其核心设计极为简洁:

  1. RL 训练阶段视为自回归模型:每一步只解码最左侧的 mask token,构造标准的从左到右生成轨迹;
  2. 直接套用标准 GRPO 算法:无需 ELBO 近似,无需处理组合爆炸,Token 概率精确且位置对齐;
  3. 推理阶段架构不变:不引入 causal mask,保留双向注意力与离散扩散公式,并行解码照常使用。

AR 约束仅是训练阶段的“脚手架”。模型学到的并非“只能从左到右生成”,而是“在分叉点敢于探索多条路径”。一旦这种能力内化,无论采用何种顺序解码,模型都能受益。

实验结果:简洁方法取得优秀表现

实验显示,JustGRPO 在 GSM8K、MATH-500、HumanEval、MBPP 等基准上全面超越 d1、ESPO、GDPO 等专为扩散模型设计的复杂 RL 方法。值得注意的是,JustGRPO 未依赖额外可训练模块或大规模私有数据。

在并行解码方面,JustGRPO 不仅保留了并行能力,且在高并行度下增益更明显。这是因为 AR 训练使模型学到了更鲁棒的联合分布,对并行采样中的近似误差更具韧性。

图注:JustGRPO 在主基准上的表现优于各类 diffusion-specific RL 方法。

图注:随着每步并行 token 数增加,JustGRPO 相对基座模型的增益反而扩大。

如果只记住三件事

一、更大的解空间,不等于更强的推理能力。
理论上的超集不代表实际采样的有效性。任意顺序在真实解码机制下,可解题目反而收缩成了 AR 的子集。

二、给模型选择的自由,它会用来回避困难。
任意顺序的 confidence-based decoding 本质上是一种推理时的 exploitation。模型利用灵活性跳过艰难决策点,导致解空间多样性过早坍缩。

三、技术复杂度攀升时,值得回头检查前提。
JustGRPO 通过做减法(移除复杂性,回归朴素 GRPO)取得了更好效果。这说明此前的许多复杂设计,可能只是在维护一个未经验证的前提。

写在最后

一个特性在理论上“能做”,并不意味着在实践中“该做”。任意顺序生成在约束满足任务上或有独到之处,但在需要长链推理的数学和代码任务上,“先做简单的、再回头补全”的策略恰恰扼杀了推理过程中最宝贵的东西——在不确定性中作出选择的能力。

归根结底,推理不是一道填空题,而是一道选择题。关键在于站在分叉路口时,是否真正面对过那些可能性。

ICML 委员会评语

2026 年 7 月 5 日,ICML 2026 公布年度奖项,本篇论文获得杰出论文奖(Outstanding Paper Award)。本届会议共收到 24,661 篇有效投稿,最终仅两篇论文获此殊荣。


“在扩散语言模型正逐步确立其作为语言生成中自回归范式有力竞争者的背景下,这篇论文提出了一个令人耳目一新的反直觉观点,挑战了该领域的一个主流假设。任意顺序生成常被视为 dLLM 得以更快生成的主要特性,而作者令人信服地表明:在通用推理任务上,dLLM 恰恰利用这种自由绕开了最关键的高不确定性'分叉'token,导致解的多样性坍缩。这是一种非显然的失效模式。基于这一洞察,作者提出重新审视 dLLM 的后训练:在强化学习 rollout 中改用更简单的固定从左到右生成顺序(即 JustGRPO),同时在推理阶段保留并行解码。”

                              ——ICML 2026 评委会

【声明】内容源于网络
0
0
AI TIME 论道
AI TIME是一群关注人工智能发展,并有思想情怀的青年学者创办的圈子,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,链接全球AI学者,以辩论的形式探讨人工智能领域的未来
内容 2178
粉丝 0
AI TIME 论道 AI TIME是一群关注人工智能发展,并有思想情怀的青年学者创办的圈子,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,链接全球AI学者,以辩论的形式探讨人工智能领域的未来
总阅读43.5k
粉丝0
内容2.2k