大数跨境

Token生成速度飙升1.5倍!自回归增强大模型Uno将扩散作为加速器

Token生成速度飙升1.5倍!自回归增强大模型Uno将扩散作为加速器 智猩猩AI
2026-09-20
6
导读:8B模型超过26B扩散模型~
智猩猩AI整理
编辑:BugMaker

现在大模型越做越强,但生成方式其实一直没有太大变化。


传统自回归大语言模型每次只能预测下一个 Token,再把这个 Token 接回输入,继续生成下一个。到了长推理、代码生成和 Agent 连续调用工具的场景,一次任务可能需要生成成千上万个 Token,这种逐 Token 串行生成带来的等待就越来越明显。


目前比较常见的解决办法是推测解码。先让一个更小的 Draft 模型快速猜出多个 Token,再交给主模型统一验证。


但这样又带来了新的问题。系统需要额外训练和维护一个 Draft 模型,同时还要处理两套模型之间的缓存和推理开销。


最近,基础模型研究院(Institute of Foundation Models,IFM)联合伊利诺伊大学厄巴纳-香槟分校、康奈尔科技学院、哈佛大学、罗格斯大学和 Cerebras Systems 等机构的研究团队,提出了扩散增强大语言模型 Uno,以及配套的 Ψ-Spec 无损多 Token 并行采样器。



这两个东西其实分别解决不同的问题。


Uno 是模型本身


它保留原来 AR 大模型的能力,同时额外加入一套轻量的扩散权重,让模型能够一次并行预测多个 Token。


Ψ-Spec 则是 Uno 推理时使用的采样器


它负责把扩散路径一次生成出来的多个 Token 交给原来的 AR 路径验证,只接受符合目标 AR 分布的结果,从而在加快生成速度的同时不改变原模型的目标采样分布。


最终,Uno 相比原始 AR 模型最高实现约 3× 加速,并且在研究团队测试的每一个 Batch Size 下,吞吐都超过 EAGLE-3 和 DFlash 等推测解码方法。


更有意思的是,团队训练的 8B Uno 在 Agent 工具调用、代码和长上下文推理测试中,还超过了总参数达到 26B 的 DiffusionGemma,以及闭源扩散语言模型 Mercury 2。



01

给AR模型加上一条

扩散生成路径    


Uno 最核心的思路并不是把现有大模型全部改造成扩散语言模型。


研究团队选择保留传统 AR 模型。


因为对于已经训练成熟的 LLM 来说,真正决定模型能力的仍然是原来的 AR 权重。Uno 不去破坏这套权重,而是在它旁边再增加一套专门负责快速生成的 diffusion weights。


这样一来,一个 Uno 模型内部实际上存在两条工作路径。


普通 AR 路径继续一个 Token 一个 Token 地生成,负责定义模型最终应该遵循的输出分布。


扩散路径则可以一次预测一组 Token,负责把串行生成变成并行生成。


研究团队将这套额外的 diffusion weights 做得非常轻量。


它并不是重新复制一个完整的大模型,而是通过 LoRA 附加到已有 AR 权重之上。


换句话说,Uno 并没有再训练一个独立的小模型来当 Draft Model。


原来的 AR 模型自己就多出了一套并行起草能力



为了得到这套扩散权重,研究团队设计了 Diffusion Distillation


训练过程中,原来的 AR 权重保持冻结,只训练额外加入的 diffusion weights。


它们学习的目标也很直接。


给定当前上下文之后,传统 AR 模型本来需要连续执行多次前向计算才能生成一段 Token,而 diffusion weights 尝试通过一次并行预测,直接给出这一整段 Token 的候选结果。


因此,Uno 并不是在 AR 和 Diffusion 之间二选一。


AR 负责模型能力,Diffusion 负责生成速度



02

Ψ-Spec让一次生成多个Token

还能保持无损    


扩散模型可以同时预测多个 Token,但光做到这一点还不够。


真正困难的问题是,这些一次生成出来的 Token 到底能不能直接使用。


如果只是为了速度,把扩散模型预测的结果全部接受,那么最后生成的文本就可能偏离原来的 AR 模型。


所以研究团队又设计了 Ψ-Spec sampler。


可以把它理解成 Uno 推理阶段的一个并行生成与验收机制


Uno 先使用 diffusion weights 一次生成一段候选 Token,然后再让原来的 AR 权重对这些 Token 统一进行验证。


符合原 AR 分布的部分留下,不符合的部分重新采样。


因此,扩散路径负责快速起草,AR 路径负责最终验收。


Ψ-Spec 真正解决的不是怎么让扩散一次生成更多 Token,而是怎么让这些 Token 在被并行生成之后,仍然严格服从原来的 AR 目标分布


这也是 Uno 所说的 lossless speedup


这里的“无损”并不是说加速前后每一次随机生成都会得到完全相同的一句话。


它指的是加速之后,模型最终采样所遵循的目标分布仍然由原来的 AR 权重定义。


为了适应不同推理负载,研究团队还为 Ψ-Spec 设计了不同的采样方式。


其中 Linear Sampler 更适合较高并发,通过减少额外分支,把重点放在整体系统吞吐上。


Tree Sampler 则会一次扩展多条候选路径,更适合 Batch Size 较小时提高单个请求的生成速度。


这套设计最终带来的效果很直接。


在官方给出的 Qwen3-8B 对比中,Uno 在所有测试 Batch Size 下都超过 EAGLE-3 和 DFlash。


在单请求场景中,Uno 的生成速度达到 445 tokens/s,原始 AR 模型为 176 tokens/s,对应大约 2.5× 加速。官方项目页这组针对推测解码方法的对比最高为 2.5×,而研究团队在完整实验中报告的最高加速可以达到 3×



03

8B模型不只更快,还超过26B 

DiffusionGemma      


如果 Uno 只是生成更快,这项工作的意义更多还是一个推理优化方案。


但研究团队还做了另一组比较。


他们直接把 8B Uno 与目前的扩散语言模型放到 Agent、代码和长上下文任务上进行测试。


其中包括 Google 的 DiffusionGemma-26B-A4B、NVIDIA Nemotron-Labs-Diffusion-14B,以及 Inception Labs 的闭源模型 Mercury 2。


结果并没有因为 Uno 只有 8B 参数就出现明显劣势。


在 τ² Telecom 工具调用任务中,Uno 得到 90.1,DiffusionGemma 为 68.1,Mercury 2 为 71


在 Terminal-Bench v2.1 上,Uno 得到 39.6,DiffusionGemma 为 14.7,Mercury 2 为 27


到了长上下文推理 AA-LCR,Uno 得到 68.0,DiffusionGemma 为 19.7,Mercury 2 为 36


Agent 编程任务上的差距同样明显。


在 SWE-bench Verified 中,8B Uno 得到 68.4,研究团队实测的 DiffusionGemma 为 18.7


这说明 Uno 想解决的并不是单纯让模型每秒多输出几个 Token。


它真正尝试保留下来的,是成熟 AR 模型原本已经获得的推理、代码和 Agent 能力,再使用扩散生成把这套能力跑得更快



研究团队还进一步把 Uno 放进强化学习训练流程。


在数学、代码、工具调用和搜索等专家训练中,diffusion weights 保持冻结,只更新 AR 权重,并使用 Uno 加速 Rollout 阶段。


当前结果显示,端到端 RL 训练速度最高可以提升约 40%


这意味着 Uno 的使用场景并不只停留在聊天模型在线推理。


对于需要大规模生成轨迹的 RL,以及未来 Token 消耗越来越高的 Agent 训练,它同样可能带来直接的计算收益。


目前 Uno 已经开放训练、推理和评测代码,并提供 Uno Qwen3 8B、Uno 7B 和 Uno 0.9B 等公开 Checkpoint。



Uno 这次比较有意思的地方,是研究团队没有继续争论 AR 和 Diffusion 到底谁应该替代谁。


它选择把两者放进了同一个模型。


Uno 让 AR 权重负责能力和目标分布,让轻量 Diffusion 权重负责一次起草多个 Token,再交给 Ψ-Spec 完成无损验证


最终得到的不是一套完全重新训练的扩散大模型,也不需要像传统推测解码一样额外维护一个独立 Draft Model。


在现有 AR 模型上增加一套轻量扩散能力,就可以把原本必须串行完成的 Token 生成变成部分并行。


从目前结果看,Uno 已经在保持原 AR 目标分布的同时实现最高约 3× 加速,并且这种加速并没有只出现在 Batch Size=1。


随着 Agent、长上下文推理和 RL Rollout 需要生成的 Token 越来越多,这种把扩散变成 AR 模型内部“加速器”的思路,可能比单纯训练一个新的扩散 LLM 更值得关注。


END


关注+星标,获取AI前沿进展与开源一线动态

【声明】内容源于网络
0
0
智猩猩AI
智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
内容 2370
粉丝 0
智猩猩AI 智猩猩旗下AI技术内容账号,关注AI大模型掀起的范式革命,追踪AI大时代涌现的开源项目。
总阅读4.1k
粉丝0
内容2.4k