微软的 Mage 模型家族 7 月再添新成员。继文生图模型 Mage-Flow 之后,视觉语言模型 Mage-VL 正式开源,4B 参数,Apache 2.0 许可。
Mage-VL 的核心思路跟 Mage-Flow 一样:用编解码器对齐的思路做高效模型。视觉部分放弃了预训练大 ViT 的路线,从零训练了一个编解码器原生的视觉编码器 Mage-ViT。只用了 1 亿张无标签图文数据,就达到了传统编码器用数十亿图文对训练的效果。
但它真正有意思的地方不在参数和速度。它有三个能力同量级模型几乎没有:视频编解码器原生理解、主动流式感知、以及一个模型同时处理图像、视频和流式三种任务。4B 参数做到了 15B 模型做不到的事。
让 AI 自己决定什么时候开口
这是 Mage-VL 跟同级别 VLM 最大的区别——主动流式感知。
传统 VLM 是被动问答器:用户输入图片或视频,模型回答。Mage-VL 可以持续观察视频流,检测到值得关注的事件时主动开口,不需要用户逐帧提问。想想自动驾驶中模型看到前车急刹自动告警、安防监控里检测到异常行为生成报告、体育直播中进球瞬间插入解说。模型不是等着被叫,而是自己看着画面。
实现方式是双系统架构,灵感来自人类认知。人不会每一毫秒都有意识地分析视觉输入,而是检测到变化时才集中注意力。System 1 就是这样——一个轻量级事件门控,用很少的计算量持续评估视频窗口的变化程度,预测「现在要不要开口」。System 1 还带一个循环记忆模块,能保留过去一段时间的观察。当触发事件时,这些历史信息传给 System 2 做上下文。
当预测指标超过阈值时,System 2 被唤醒——一个完整的 VLM 模型,对当前窗口做全面的视觉理解和自然语言描述。System 1 的计算代价远低于完整 VLM 前向推理,所以大部分时间只跑轻量系统,只有需要时才投入完整计算。这在边缘设备和实时系统中很实用。
在 SoccerNet 足球比赛数据上测试,Mage-VL 的时序价值得分 55.54,远超对手的 19.25。更有意思的是 OVO-Bench 在线视频理解基准:Mage-VL 以每秒 1 帧流式输入拿到 64.00 分,超过了 Qwen3-VL-4B 用 64 帧离线分析的 63.00——信息量更少,理解效果反而更好。
借鉴视频压缩思路的视觉编码器
Mage-VL 处理视频的方式跟其他模型完全不同。
传统 VLM 用均匀帧采样处理视频——每隔固定间隔取一帧,每帧的每个 patch 都处理。相邻帧之间信息大量重复,模型把计算花在几乎不变的区域上。比如一段足球比赛,背景的草地和看台每帧都一样,只有球员位置在变化——均匀帧采样无法区分哪些区域重要。
Mage-ViT 的思路来自视频压缩。视频编解码器用 I 帧和 P 帧组合压缩:I 帧完整编码全部信息,P 帧只编码相对于前一帧的变化。Mage-ViT 把这个概念搬到视觉编码中。Anchor 帧保留全部 patch(类似 I 帧),Predicted 帧只保留运动显著的区域(类似 P 帧)。哪些 patch 保留,由编码器提取的运动向量和残差能量决定——这两个指标在编解码过程中天然存在,Mage-ViT 几乎零成本获得了每一帧的显著性图。
这个设计是编解码器无关的。传统 H.264 和 HEVC,或者神经编解码器 DCVC-RT,都可以通过同一个接口接入。模型不关心底层编码方式,统一接收运动显著性评分。从部署角度看,视频平台不需要额外开发——现有的编码基础设施直接服务于模型推理。
视觉 token 减少 75% 以上,推理速度最高提升 3.5 倍。同时因为保留的就是最关键的变化信息,在需要逐帧追踪的任务上效果反而更好。
JumpScore 最能体现这个优势——它衡量模型在帧之间追踪物体变化和推理状态演变的能力。Mage-VL 得分 45.60,Qwen3-VL 只有 3.82,相差将近 12 倍。Qwen3-VL 的 3.82 分说明它几乎不具备逐帧追踪能力——均匀帧采样把关键的运动信息丢失了。Mage-VL 的 P 帧保留的就是变化部分,这种任务天生适合它的架构。
4B 打 15B 的效率奇迹
在图像理解上,Mage-VL 在 12 项基准上全面领先同参数的 Qwen3-VL-4B。DocVQA 文档理解 95.14 对 94.69,ChartQA 图表问答 84.88 对 83.96,MMStar 多模态推理 67.32 对 62.04。
对上 15B 参数的 Phi-4-Reasoning-Vision 差距更夸张。在文档理解、图表理解、视频理解等多个维度 Mage-VL 表现更好。多文档问答 MultiDocVQA 上 Mage-VL 得分 87.46,Phi-4-MM 只有 46.84,差了 40 多个百分点。一个 4B 模型在 15B 模型面前不落下风甚至反超,说明架构设计和训练策略的价值大于参数规模。
视频领域优势更大。VideoMME 64.0 对 59.7,LongVideoBench 61.3 对 57.7,VSI-Bench 视频空间推理 64.3 对 53.3,VideoEval-Pro 45.2 对 20.7——差距 2 倍以上。
能做到这一切,关键之一是微软自研的 AI4AI 数据管线。让 AI 来帮 AI 做数据:用 AI 生成高质量图文和视频密集描述,替代人工标注,再用 AI 诊断模型在各维度的表现,找出薄弱环节指导数据优化方向。不需要人工介入。
五阶段训练,一个统一模型
训练分五个阶段,全部是有监督学习,没用 RLHF。
视觉编码器 Mage-ViT 无监督预训练→图像和文本对齐→视频和文本对齐→多任务联合微调→流式门控训练。最后一个阶段只训练 System 1,不改 VLM 主干。
最关键的是五个阶段产出同一个模型。一个 checkpoint 同时支持静态图像问答、视频均匀采样理解、编解码器原生视频输入和主动流式感知。推理时自动选路——图片走静态路线,采样帧走均匀帧路线,编码视频流走编解码器路线,启用门控进流式模式。
总结与展望
Mage-VL 代表的是一种新设计哲学:不做视觉编码器的大规模预训练和尺寸膨胀,从编解码器的底层逻辑做减法。4B 参数达到 15B 级别的效果,同时有同尺寸模型没有的流式感知能力。
这套方案也有局限。编解码器原生处理需要输入视频经过编码器预处理,对格式和编码方式有依赖。主动流式门控的触发阈值需要针对场景调参,通用性有提升空间。目前只在英伟达 GPU 上完成部署优化,端侧和移动端适配还没公开——而主动流式最需要落地的恰恰是端侧。
微软以 Apache 2.0 开源了完整权重,包括独立视觉编码器 Mage-ViT。对于研究者来说,Mage-ViT 可以单独用于自定义 VLM 训练。当大多数 VLM 还在卷参数规模和数据集大小的时候,Mage-VL 提供了一条做减法的路——更少的 token、更少的训练数据、更小的模型,但更深的视觉理解。

