大数跨境

论文解读|FullDiT:让利用全信息的生成式 DiT 学会修正不完美的 Token 规划

论文解读|FullDiT:让利用全信息的生成式 DiT 学会修正不完美的 Token 规划 阿里语音AI
2026-08-26
2
导读:用全信息建模与错误模拟,把不完美的 Token 规划纠正回音乐。

现有的高质量音乐生成系统多采用两阶段设计:Planner(规划器)是自回归语言模型,负责根据歌词和提示词生成长程的离散 Codec Token 序列。Renderer(渲染器)则为  Diffusion 或 Flow Matching 模型,负责将 Token 还原为高保真波形。

但这里存在一个容易被忽视的问题:训练时,声学渲染器看到的是“标准答案”,只负责重建真实音频;真正上线时,它面对的却是上游模型带着错误的预测结果。如果 Renderer 只是机械地“重建 Token”,那么一旦上游 Token 出错,错误就很可能被一路放大到最终音频。

阿里团队在最新的论文中提出的 FullDiT(Full-Context Generative DiT)正是为解决这一问题而设计:不再把声学 Renderer 看作一个 Codec 重建器,而是将其重新定义为一个在不完美离散音乐规划的条件下,利用歌词、文本语义和全曲上下文重新完成音乐生成的生成式 DiT。

论文原文将训练和推理阶段之间的分布差异称为 Codec-interface Exposure Bias(Codec 接口暴露偏差)。围绕这个问题,FullDiT 主要做了三件事:全曲全信息全上下文建模、EMDC 错误模拟,以及 4-way CFG 多条件引导。

(图 1:FullDiT 整体架构示意

Full-Context:全信息全上下文建模

传统长音乐生成为了控制计算量,把歌曲切成 10 秒、30 秒这样的局部窗口,然后分别渲染生成。但音乐并不是一系列彼此独立的 30 秒片段:主歌中的旋律可能需要和一分钟后的副歌呼应;第二遍 Chorus 应该与第一遍保持一致;前奏中的 Motif 可能在结尾重新出现;人声、配器和动态需要在整首歌曲维度保持连贯。

因此 FullDiT 采用 Non-causal Full-song Attention。对于任意一个声学 Frame,模型不仅能够看到对应位置的 Codec Token,同时可以访问整首歌曲过去和未来的声学状态。

同时,FullDiT 把 Lyrics 和 Caption 重新送给 Renderer。文本信息 Caption / Lyrics 经过 LLM → Codec Token 之后,并不能保证所有语义信息都完整保留下来。如果 Renderer 只接受 Codec Token,那么 Codec Token 就形成了一个 Information Bottleneck。所以 FullDiT 选择了一条更加直接的路线:让 Renderer 自己也看到原始 Lyrics 和 CaptionLyrics 和 Caption 分别经过独立 Encoder,在每一个 Transformer Block 中与 Audio State 共同参与 Attention。

因此,FullDiT 最终面对了三类信息:

  • Codec:离散音乐规划

  • Lyrics:歌词段落信息

  • Caption:风格、乐器、情绪等音乐描述

EMDC让模型提前见过“真实的错误”

如果 FullDiT 的输入在真实推理阶段会包含错误,那么一个直接的想法就是:训练时也给它制造一些错误。最简单的方法可能是随机替换 Token。例如统一设置 20% 的 Mask / Corruption Ratio,然后从整个 Codebook 中随机采一个 Token 替换。但论文认为,这种方法与真实 LLM 犯错的方式差距仍然很大,原因有两个。

第一,不同 Codebook 的预测难度完全不同。

FullDiT 使用 8 层 RVQ Codebook。论文统计了上游语言模型在不同 Codebook 上的 Teacher-forced Top-1 Accuracy。可以看到,真实预测时,不同 Codebook 的错误概率并不相同,Codebook 越深,预测越困难。

(表 1:各层 Codebook 的 EMDC 校准参数。其中 Acc@1 决定该 Token 是否替换,Kk 为启发式确定的近错候选邻域宽度

第二,模型的错误通常不是“完全随机”。

语言模型预测错 Token 时,往往不会随机跳到一个语义完全无关的 Token。更常见的是:预测成 Near-miss Token。因此本文提出了 Error-Matched Distractor Conditioning(EMDC)对于第 k 个 Codebook,FullDiT 根据上游语言模型的 Top-1 Accuracy 设置 Token 替换概率:

也就是说,越容易预测错的 Codebook,训练时就注入越多错误。当某个 Token 需要被替换时,EMDC 不会随机采样,而是在对应 Codebook 的 Embedding Space 中寻找 Cosine Top-Kk Neighbors,再从中采样一个 Near-miss Token

其中,Near-miss 的候选范围根据各层预测难度设置

并结合 Codebook 深度做取整和调整,因此从浅层的 Top-20 逐渐扩大到深层的 Top-180。这一设置是工程启发式,并不是严格的理论等价关系。

同时,EMDC 只改变输入 Codec Token,不改变训练 Target。假设原始 Token 是 A,EMDC 将其替换为相近但错误的 Token B,FullDiT 的目标仍然是生成原始正确音乐,而不是 B 对应的声音。因此,模型学到的是:当 Codec Plan 中出现错误的 Token 时,结合 Lyrics、Caption 和 Full-song Context 将结果纠正回来。


4-Way CFG:四维无分类器引导

传统的 CFG 只有一个 Scale,但 Codec、歌词、Caption 对生成的贡献维度完全不同。于是 FullDiT 提出了 Four-Way Classifier-Free Guidance(4-CFG)

通过独立调节 scodec、slyr、scap,可以精细控制生成结果对旋律、歌词和风格的侧重。实验表明,(1, 2, 1) 的组合在主观听感上达到了最佳平衡。

(图 2:4-Way CFG 参数搜索实验结果

系统级表现

研究团队将包含 FullDiT 渲染器的完整系统与 Suno V5.5/V5、Mureka V8、Lyria 3 Pro、MiniMax Music 2.6 五个顶尖商业系统进行了对比。在涵盖 8 大语种、500 首声乐作品的通用测试集上,FullDiT 在 18 项自动指标中的 15 项取得最优。

(表 2:多语种多流派声乐作品通用测试集上的评测结果

结语

FullDiT 重新审视了声学渲染器在两阶段音乐生成系统中的角色:它不再是一个只见过“标准答案"的 Codec 重建器,而是一个直面不完美离散规划的全信息生成式 DiT。通过全信息全上下文建模、匹配真实分布的错误模拟(EMDC),以及多维度独立调节的条件引导(4-Way CFG),模型学会了在歌词、音乐描述和全曲上下文的帮助下,把错误的规划纠正回正确的音乐。

一思路对更广泛的多阶段生成系统也有借鉴意义:当下游模块在训练时接收的是“标准答案”,而推理时面对的却是上游模型的预测结果,训推不一致就会产生。在训练时,让下游模型面对与真实部署误差分布相匹配的非理想输入,并保留足够的原始条件与上下文,使它具备判断、补全、纠正上游规划的能力。


相关文献参考:

[1] Dai, Junyu, et al. "Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering." arXiv preprint arXiv:2607.20253 (2026).

[2] Bai, Ye, et al. "Seed-music: A unified framework for high quality and controlled music generation, 2024." URL https://arxiv.org/abs/2409.09214.

[3] Yang, Chenyu, et al. "Songbloom: Coherent song generation via interleaved autoregressive sketching and diffusion refinement." Advances in Neural Information Processing Systems 38 (2026): 34256-34277.

[4] Zhang, Chong, et al. "Inspiremusic: Integrating super resolution and large language model for high-fidelity long-form music generation." arXiv preprint arXiv:2503.00084 (2025).

[5] Yang, Dongchao, et al. "Heartmula: A family of open sourced music foundation models." arXiv preprint arXiv:2601.10547 (2026).



 往期推荐 
 Recommend 






























































                            
记得关注










👇点击阅读原文,直达论文原文


【声明】内容源于网络
0
0
阿里语音AI
阿里巴巴通义实验室语音团队,基于多模态大模型语音识别、语音合成、自然语言理解等 AI 技术,实现“能听、会说、懂你”式的智能人机交互体验。
内容 146
粉丝 0
阿里语音AI 阿里巴巴通义实验室语音团队,基于多模态大模型语音识别、语音合成、自然语言理解等 AI 技术,实现“能听、会说、懂你”式的智能人机交互体验。
总阅读1.1k
粉丝0
内容146