微软放出全新 Mage 多模态模型家族,4B 参数量同时覆盖图像生成编辑、流式视频理解,全套权重与代码开源,适合科研与二次开发。
现有多模态普遍存在痛点:视频理解需要采样大量帧,Token 爆炸推理缓慢;图像生成模型训练部署成本高,小硬件很难跑通高质量模型。
近期微软正式开源 Mage 多模态模型系列,整套模型锁定 4B 参数规模,不再盲目堆砌大参数量,分为两大模块:负责图像生成与编辑的 Mage‑Flow,支持原生分辨率图像生成、指令式编辑,Turbo 版本仅需 4 步即可完成图像输出,单卡 A100 生成 1024×1024 图片不到 0.6 秒。以及面向图片、实时流式视频理解的 Mage‑VL,视觉 Token 减少 75%,推理最高提速 3.5 倍,实现实时流式视频感知;
整套项目完整开源代码、模型权重与两篇技术报告,采用宽松开源协议,非常适合研究者做二次训练、微调实验,以及中小算力环境下落地多模态业务。
相关链接
-
代码仓库:https://github.com/microsoft/Mage -
项目主页:https://microsoft.github.io/Mage/ -
论文(Mage‑VL 流式多模态):https://arxiv.org/pdf/2607.24904 -
论文(Mage‑Flow 图像生成编辑):https://arxiv.org/pdf/2607.19064 -
模型权重:https://huggingface.co/microsoft/Mage‑VL
介绍
Mage 模型家族包含两大核心子模型,整体设计思想为:算力优先分配给真正有信息变化的区域,而不是对全部像素做无差别编码。
Mage‑VL:Codec‑Native 流式多模态理解模型
传统多模态视频模型均匀采样全部帧,大量重复静态画面带来冗余 Token,推理速度慢,很难处理直播、实时监控这类流式场景。
Mage‑VL 自研 Mage‑ViT 编码器,参考 H.264/HEVC 视频编码思路,区分 I 关键帧与 P 预测帧;完整保留关键帧全部 Patch,预测帧只保留运动、内容发生改变的区域,直接丢弃静态不变部分,视觉 Token 总量降低 75% 以上,时空上下文信息不会丢失,视频推理速度最高提升 3.5 倍。
模型采用仿生双系统架构:System1 轻量事件网关监控画面变化,只有出现关键事件才触发完整推理;System2 因果解码器完成多模态问答、视频描述。在静态图文任务上对标 Qwen3‑VL‑4B,视频理解任务取得明显优势,原生支持普通视频流、神经网络编码视频,适配实时解说、监控分析等场景。
Mage‑Flow:原生分辨率图像生成 & 编辑模型
Mage‑Flow 面向文生图、指令图像编辑任务,核心组件为 Mage‑VAE 编码器与 NR‑MMDiT 原生分辨率扩散 Transformer,基于 Rectified Flow 匹配训练。
-
Mage‑VAE:重建质量对标 FLUX.2 的 VAE,同时大幅降低编码计算开销。 -
提供 Base 基础版、RL 对齐版、Turbo 蒸馏加速版,同时配套 Edit 编辑分支,支持掩码局部修改。 -
原生支持 512‑2048 任意分辨率,不需要尺寸桶训练;Turbo 版本 4 步快速采样,A100 上单卡 1024×1024 图像生成仅 0.59 秒,编辑任务 1.02 秒完成。 实验表明,4B 规模的 Mage‑Flow 在提示词遵循度、画面细节、文字渲染上,可以匹敌参数量大得多的开源图像模型。
结论
Mage 代表了一种新的思路:不一定靠更大参数量提升能力,通过视觉编解码层面的系统优化,4B 规模就同时兼顾高质量图像生成和高效流式视频理解。 Mage‑VL 解决了传统多模态处理视频时 Token 爆炸、推理缓慢的痛点,为实时视频理解、直播内容分析打开落地可能性;Mage‑Flow 把高质量图像生成编辑的硬件门槛大幅压低。全套资源开源释放,对科研人员非常友好,后续可以期待更多基于 Mage 的二次创新工作。对于工业落地,这套模型也给边缘设备部署多模态提供可行参考。
感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~

