(本文阅读时间:15 分钟)
欢迎阅读“科研上新”栏目。本栏目汇聚微软亚洲研究院最新创新成果与科研动态,助您快速捕捉前沿技术脉搏,保持对 AI 领域发展的敏锐洞察。
作为人工智能领域最具影响力的两大学术会议,ACL 与 ICML 汇聚了自然语言处理、机器学习及智能体等方向的最新研究成果。今年,微软亚洲研究院有多篇论文入选两大会议,持续推动大语言模型与智能体技术的发展。本期“科研上新”精选五项最新研究,涵盖文本世界模型、多模态视觉推理、GUI 智能体训练环境合成、大语言模型高效训练以及在线监督微调等方向。
面向视觉 - 语言推理的分解式在线蒸馏:通过梯度引导实现视觉定位(ICML 2026 Spotlight)
从文字到世界:大语言模型能否成为隐式的文本世界模型?(ACL 2026 Oral)
InfiniteWeb:可扩展的网页训练环境合成
迈向高效的大语言模型退火训练:基于原则性样本选择的方法(ICML 2026 Spotlight)
通往在线监督微调(On-Policy SFT):分布判别理论及其在大语言模型训练中的应用
01 面向视觉 - 语言推理的分解式在线蒸馏:通过梯度引导实现视觉定位(ICML 2026 Spotlight)

论文链接:
https://arxiv.org/abs/2606.00564
多模态大语言模型在利用策略蒸馏进行推理训练时,常受限于单一的单片式目标函数。这种方法未能充分平衡语言建模与视觉感知之间的内在张力,导致模型在处理需深入理解图像的复杂推理任务时,视觉接地能力(visual grounding)成为性能瓶颈。
针对这一难题,研究员通过数学分解损失函数,揭示了语言先验与视觉接地目标在几何空间上近乎正交的特性。常规的单片式蒸馏被动平衡两者,难以有效增强感知保真度。为此,研究团队提出视觉梯度引导方法 VGS(Visual Gradient Steering)。该方法引入辅助视觉目标,通过动态重定向优化轨迹,显式优先处理视觉子空间,并结合语言保持正则化器,在强化视觉接地的同时,避免对原有语言推理能力造成负面影响。

图 1:视觉梯度引导 VGS 概述。(左)针对多模态查询,从学生模型策略中采样 rollout,分别计算多模态和单模态场景下学生与教师模型的对数概率。(中)将标准整体目标分解为语言先验(匹配纯文本分布)和视觉锚定目标(提取视觉信息增益)。(右)几何分析表明,VGS 明确将梯度更新导向视觉子空间,优先保障感知保真度。
实验表明,VGS 显著提升了学生模型在多项复杂多模态推理基准测试中的表现。该方法不仅在纯蒸馏设置下效果优越,还可作为有效的正则化手段融入强化学习微调流程,在保持推理链连贯性的基础上,大幅增强感知准确度。
02 从文字到世界:大语言模型能否成为隐式的文本世界模型?(ACL 2026 Oral)

论文链接:
https://arxiv.org/abs/2512.18832
智能体学习高度依赖交互经验,但真实环境交互成本高、覆盖有限且动作不可逆,制约了规模化训练与可靠决策。虽然世界模型有望缓解这些瓶颈,但大语言模型能否作为可靠的世界模型并为下游智能体带来实质收益,尚缺乏系统性评估。
对此,研究员提出了由保真度与一致性、可扩展性与鲁棒性以及智能体效能组成的三层评估框架。该框架聚焦文本环境,将其作为连接语言建模与世界建模的统一接口,并将目标从单纯的下一词预测重构为交互协议下的下一状态预测。

图 2:大语言模型作为基于文本的智能体学习世界模型。通过预测环境动态,基于大语言模型的世界模型能够实现低成本数据合成、可扩展学习及可回溯决策。
通过在五种代表性文本环境中的评估,研究发现:首先,经过充分训练的模型能捕捉环境内隐动态,并在结构化设置中表现出高保真度,其中监督微调至关重要;其次,世界模型性能随数据量、参数规模及环境复杂度增加而系统性地扩展;最后,高质量世界模型能为下游智能体带来显著提升。例如,在 WebShop 环境中,行动验证使 GPT-4o 性能提高 5.5%;在 SciWorld 环境中,采用热启动强化学习实现了约 15% 的增益。这证实了将语言模型作为文本环境世界模型的潜力,为推动智能体学习向更广泛场景演进奠定了实证基础。
03 InfiniteWeb:可扩展的网页训练环境合成

论文链接:
https://arxiv.org/abs/2601.04126
GUI 智能体在构建实用 AI 助手方面潜力巨大,但缺乏支持大规模训练的合适环境。现有基准测试使用的真实网站存在多样性单一、限流及任务不可撤销等问题,难以支撑稳定的强化学习训练。
为此,研究员推出 InfiniteWeb 系统,能够大规模自动生成适用于 GUI 智能体训练的功能性网页虚拟环境。该系统以网站种子描述和设计图为输入,通过统一接口规范,由任务推导共享数据模型与 API,确保跨页数据一致性。
在功能层面,系统采用任务驱动测试开发模式,迭代修正业务逻辑以保证正确性;在视觉层面,结合真实网页截图特征引导前端生成,维持风格多样性。此外,系统还能自动产生带有代码插桩的可验证任务评测器,输出稠密奖励信号供训练使用。

图 3:InfiniteWeb 生成的多样化网站示例,涵盖电子商务、预订平台、社交媒体等多个领域。
端到端实验结果表明,InfiniteWeb 在构建真实网页环境方面超越了主流商用代码智能体。以此合成环境训练的 GUI 智能体,在 OSWorld、Online-Mind2Web 和 MobileWorld 上分别提升 6.9%、5.7% 和 3.9%。这证明合成环境具备较高真实性与跨平台迁移价值,为大规模 GUI 智能体训练提供了可扩展方案。
04 迈向高效的大语言模型退火训练:基于原则性样本选择的方法(ICML 2026 Spotlight)

论文链接:
https://arxiv.org/abs/2605.31175
大语言模型预训练的退火阶段是模型收敛并确立质量的关键时期,但该阶段的数据选择策略仍具挑战。常规方法多依赖经验启发式规则,缺乏优化理论依据。研究员从损失地形的谱几何视角刻画退火阶段,指出优化收敛要求梯度更新满足不同特征方向上的异构约束。
为此,研究团队提出 DiReCT 框架,将退火阶段的样本选择重构为约束优化问题。该框架基于黑塞矩阵的谱特性,对每个样本的梯度施加明确的方向约束,从而识别出符合最优曲率感知下降路径的样本。
为实现高效计算,DiReCT 利用随机投影技术近似高维梯度,显著降低开销。整套数据调度流程仅需在训练前对数据集做一次推理即可完成预计算。此外,借助连续松弛和逐次凸近似(SCA)求解器,该方法有效解决了非凸对齐约束下的组合优化难题。

图 4:不同训练阶段优化动态的几何对比。退火阶段机制能够抑制横向噪声并最大化纵向信号,使模型沿低曲率山谷高效向最优解下降。
实验表明,DiReCT 在各种模型规模下均达到业界领先性能。其核心优势在于主动选择在平坦子空间内放大下降信号、同时抑制尖锐方向噪声的样本,从而在导航几何瓶颈时保持稳定收敛。理论分析通过 PAC-Bayes 边界证明,这种基于平坦方向选择的更新能够收缩轨迹曲率,改善泛化能力。数据分析显示,算法倾向于选择预训练损失更高且序列更长的样本,这类样本能提供充足梯度能量,推动优化沿平坦损失曲面加速收敛。
05 通往在线监督微调:分布判别理论及其在大语言模型训练中的应用

论文链接:
https://arxiv.org/abs/2602.12222
在大语言模型训练后期,监督微调虽计算高效,但泛化能力通常弱于强化学习。这主要因为强化学习采用策略内数据,能保留模型原有分布特征并缓解灾难性遗忘,而标准监督微调强制拟合所有外部数据,易损害预训练知识结构。
为弥合这一差距,研究员提出分布判别理论 DDT,基于信号检测理论提供线性阈值决策视角,并确定中心化对数似然(CLL)作为衡量分布判别的最优标准。在序列生成场景下,通过构建 CLL 统计量化生成序列与模型分布的对齐情况。

图 5:使用多种先进大语言模型及不同数据类型对该理论进行经验验证。
基于上述理论,研究团队开发了两种互补应用技术:一是分布内微调(IDFT),在损失函数层面通过自适应调节机制,赋予模型内部分布中高置信度样本更高权重,保护模型结构避免过拟合;二是提示解码(Hinted Decoding),在数据层面通过解码过程动态将训练语料重新对齐至模型自身分布,生成更匹配的训练样本。
广泛实验结果表明,该框架在保持监督微调高效性的前提下,不仅有效缓解灾难性遗忘,泛化性能还超过了 DPO 和 SimPO 等常用离线强化学习算法。这为强化学习实施难度较大的领域,提供了一种极具实用价值和数据效率的替代方案。

