(本文阅读时间:15 分钟)
欢迎阅读“科研上新”栏目!这里汇聚微软亚洲研究院最新创新成果与科研动态,助您快速捕捉前沿技术脉搏,保持对 AI 领域发展的敏锐嗅觉。
上周,第 43 届 ICML 大会在韩国首尔召开。此前两期"ACL + ICML 上新”分别精选介绍了微软亚洲研究院在两个大会上发表的关于大模型多元文化价值观对齐以及大模型智能体构建等方向的前沿研究。
本期聚焦 ICML,分享五项精选创新成果,围绕世界模型构建、轻量化扩散编解码、视觉高效压缩、跨模态统一建模与视频时序推理等核心技术难题,带您探索机器学习领域的最新突破。
让虚拟世界告别遗忘:构建具有持久三维记忆的世界模型
CoD-Lite:基于扩散模型的实时生成式图像压缩
一个向量,装下整段视频:视觉生成模型里的隐式记忆表征
基于下一词元扩散的多模态隐式语言建模
ViTL:融合交错式推理的长视频问答
01 让虚拟世界告别遗忘:构建具有持久三维记忆的世界模型

论文链接:
https://arxiv.org/abs/2603.03482
现有交互式世界模型常缺乏环境的三维显式表示,仅能隐式学习三维一致性。受限于有限的时间上下文窗口,其空间记忆在长程推演中易丢失信息,导致“边生成边遗忘”,难以适配沉浸式交互和智能体训练任务。
针对该瓶颈,研究员提出 PERSIST 框架,通过隐空间中的三维环境帧(world-frame)显式建模环境随时间演化的状态。模型维护并预测一个三维环境帧以保存持久空间记忆,同时预测相机状态,将三维信息投影至可观测的二维屏幕空间;最后利用 world-to-pixel 生成模块,结合投影后的三维特征、动作及二维图像特征合成当前视频帧。
训练阶段,PERSIST 使用 2D-VAE 和 3D-VAE 分别编码视频帧和三维环境帧。环境帧预测器和生成器采用 Rectified Flow 框架,相机模型通过因果 Transformer 预测位置、朝向和视场变化。为缓解自回归推理误差累积,模型引入 Diffusion Forcing 和随机噪声增强,使各模块适应推理阶段由其他模块生成的隐空间特征。

图 1:以单个视频帧初始化后,PERSIST 会根据用户动作在自回归循环中持续迭代世界状态。模型首先预测智能体周围的三维环境帧,并用前馈 Transformer 预测相机参数,随后将三维世界投影到相机平面,得到深度排序的世界隐特征;最后利用这些与像素对齐的三维信息,对像素隐特征去噪并合成下一视频帧。
02 CoD-Lite:基于扩散模型的实时生成式图像压缩

论文链接:
https://arxiv.org/abs/2604.12525
高性能生成式压缩领域通常依赖大幅扩充参数量提升重建效果,但这导致极高的推理延迟,难以满足实时落地需求。如何平衡模型规模与运行效率,设计轻量化扩散架构成为关键问题。
为突破局限,研究员通过多组实验验证了压缩导向扩散预训练的优势。研究表明,相比通用生成扩散预训练,该方案能在轻量化模型上生成信息密度更高的图像表征,弥补小模型能力不足。此外,图像压缩任务无需全局注意力,轻量化卷积网络搭配蒸馏学习即可还原精细纹理。
基于此,研究员构建了轻量级一步式卷积扩散图像编解码器。该方法采用紧凑卷积主干,通过压缩导向扩散预训练及统一的蒸馏与对抗训练框架,在 A100 GPU 上实现了 1080p 分辨率下 60 FPS 编码速度与 42 FPS 解码速度。在保持与 MS-ILLM 等 GAN 类编解码器相当 FID 指标的同时,节省 85% 比特率,有效 bridging 了生成式压缩与实际部署场景。

图 2:生成式图像编解码器的发展主要依赖扩大模型规模,导致解码延迟增加。相比之下,CoD-Lite 在感知质量与解码速度间实现更优平衡:在 A100 GPU 上实现实时 1080p 解码,同时达到接近最先进的 FID 值。
03 一个向量,装下整段视频:视觉生成模型里的隐式记忆表征

论文链接:
https://arxiv.org/abs/2603.07615
现代视觉生成大模型虽沉淀了丰富的先验知识,但传统视觉表征(如像素、隐变量、图像标记)独立于生成模型,无法直接复用内置知识,难以在极低码率下实现高效存储与内容复用,导致画质严重衰减。

图 3:基于扩散生成模型的单向量视觉压缩(左)和生成(右)框架。
04 基于下一词元扩散的多模态隐式语言建模

论文链接:
https://arxiv.org/abs/2412.08635
多模态生成长期面临异构数据难以统一建模的难题:文本和代码为离散词元,而图像、音频、视频及机器人动作具有连续性。现有方案多采用拼接独立模块的流水线框架,难以端到端联合优化,且易在交互中产生信息损耗。
为此,研究员提出潜语言建模 LatentLM。该框架以因果 Transformer 为共享主干,通过 VAE 将不同模态连续数据压缩为潜向量,并引入下一词元扩散机制。对于连续模态,模型以 Transformer 隐状态为条件,通过轻量级扩散头自回归生成潜向量;对于文本等离散模态,则沿用标准下一词元预测分支。此外,配套设计的σ-VAE 有效缓解了潜空间方差坍塌问题。

图 4:潜语言模型 LatentLM 以因果 Transformer 为共享主干,统一处理图像、音频、视频等连续数据,以及文本和代码等离散数据。该方法引入下一词扩散机制,通过自回归方式逐个生成潜在向量,提供通用接口实现多模态生成与理解的统一。
实验表明,在 ImageNet 图像生成任务中,4.79 亿参数的 LatentLM 取得 2.24 的 FID 指标,以更少参数超越 6.75 亿参数的 DiT-XL/2(FID 2.27)。随着模型规模扩大,LatentLM 表现出良好的可扩展性,推理吞吐量最高提升 2.84 倍。融入多模态大模型后,其在语言建模困惑度、文生图 FID 和视觉问答等指标上均优于 Transfusion 及向量量化基线。
在语音合成任务中,σ-VAE 实现 1600 倍超高压缩比,解码步数仅为 VALL-E 2 的十分之一,并在说话人相似度和音频鲁棒性方面表现更优。该框架可复用大模型现有的分布式训练体系,为统一多模态理解与生成提供高效且易扩展的技术路径。
05 ViTL:融合交错式推理的长视频问答

论文链接:
https://arxiv.org/abs/2510.04022
长视频问答长期受困于“固定算力预算”与“答案藏在短暂片段”的矛盾。由于 token 和帧数存在上限,现有模型多采用均匀或启发式采样,将大量容量消耗在无关背景上,遗漏关键片段。此外,现有训练集很少将问题与真实时间区间绑定,导致评测可追溯性差,且时序定位与问答模块分开优化,难以转化为答题准确率的提升。
针对该瓶颈,研究员提出 ViTL(Video-in-the-Loop)两阶段框架。第一阶段,模型用低帧率快速浏览完整视频,定位相关时间段;第二阶段放大对应片段,以更高有效帧率编码画面并完成作答。两阶段共享固定 token 总量,将视觉算力重新分配给关键证据片段。
训练采用交错式组相对策略优化(GRPO),耦合时序 IoU 定位指标与答题奖励,引导模型优先学习利于正确作答的视频片段。为补齐监督信号,研究员搭建 VGrounding-QA 数据集,依托 GPT-4o 对视频做细粒度结构化解析,提取实体并构建事件知识图,生成绑定真实时间区间的多时段问答样本。

图 5:ViTL 与 VGrounding-QA 框架总览。给定长视频与问题,阶段 1 从问句中提取定位查询,预测相关时间区间;阶段 2 仅对筛选片段做高保真重编码,完成多选问答。整套流程采用 R1 类强化学习循环训练方案,联合优化时序 IoU 与问答两大目标。
实验显示,ViTL 仅以 128 帧输入即在 LVBench 上达到 47.4%,超过 256 帧均匀采样的 Qwen2.5-VL 7B 基线(43.7%),并以 50% 的帧输入量取得最高 8.6% 的性能提升。消融实验表明,基于片段感知的 token 分配始终优于全局均匀采样。ViTL 验证了固定算力下聚焦证据片段的设计思路,兼顾答题精度与时序可追溯性,为高效、可解释的长视频大模型推理提供了可行方案。

