多模态联合预训练已成为大模型演进的关键方向,从 GPT-4o、Gemini 到 Kimi3 均印证了这一趋势。然而,行业在模态交互机制、数据配比及引入顺序等关键决策上,长期依赖经验与直觉,缺乏严谨的理论支撑。
牛津大学博士、Meta FAIR 研究员韩俊霖团队近期发表论文《迈向多模态预训练的物理学研究》(Towards Physics of Multimodal Pretraining),借鉴“语言模型物理学”框架,通过严格受控实验揭示了多模态训练的底层规律。研究团队先在合成数据中建立因果判断,随后利用约 3.5 亿对图文数据及大规模真实数据,在多种视觉表征设计下验证了结论的普适性。
核心发现:知识流动的不对称性与架构机制
研究表明,多模态间的知识流动存在显著不对称性:语言是视觉能力的“万能助推器”,视觉理解可有效驱动视觉生成,但视觉生成对其他能力的正向贡献微乎其微。这种不对称性呈现分层特征:颜色、形状等底层概念难以在理解与生成间零样本迁移,而空间关系、数量等高层结构概念则可从理解单向迁移至生成。
图 | 语言数据规模变化对视觉理解及生成能力的影响。(来源:arXiv)
在架构层面,模态间的协同与竞争取决于任务复杂度。前馈网络(FFN)是资源竞争的主要区域,建议按模态解耦;而注意力机制(Attention)和归一化层(Norm)则是协同桥梁,适合跨模态共享资源。此外,研究指出“视觉惰性”现象:若视觉数据引入过晚,训练充分的语言主干会倾向于走语言捷径,导致视觉通路参与度降低。因此,原生多模态训练应尽早启动。
基于遍历实验,团队提出了最优训练配方:语言数据占 70%、视觉理解占 25%、视觉生成占 5%。该方案在 135 亿参数混合专家模型及 2 万亿 Token 规模上验证,表现全面优于平衡配比及其他基线。这为多模态训练提供了一套可解释、可复现的严谨框架。
从 3D 生成到多模态 Scaling 的范式转移
针对研究方向从 3D 生成转向多模态统一预训练的决策,韩俊霖指出,通用智能的核心在于可扩展性(Scaling)。3D 数据稀缺且获取成本高,难以支撑大规模训练;相比之下,视频数据潜力巨大,仅 YouTube 的数据量便足以支撑行业长期发展。尽管语言数据面临瓶颈,需依靠合成数据补充,但视频数据的 Scaling 远未见顶,关键在于如何构建适配的架构与融合范式。
关于英美科研环境的差异,韩俊霖表示,美国湾区学界与业界联系紧密,更聚焦基础模型与 Scaling 研究;英国学界受限于业界资源,更多关注监管与安全议题。在算力分配上,Meta 支持大规模预训练探索规律,而牛津大学则受限于算力,更多聚焦后训练、可解释性及安全性等细分领域。
方法论:受控实验与黑箱机制解析
本研究采用“受控实验物理学”方法,旨在干净环境中提炼可迁移的宏观规律,区别于侧重逆向工程的“机制可解释性”。针对视觉生成对理解反向促进较弱的问题,研究发现生成任务虽学到了像素级特征(如颜色、形状),但在高层 VQA 测试中难以体现。若测试任务涉及物体追踪等对像素要求更高的场景,生成的作用将更为显著。
在概念迁移的光谱中,阈值约位于底层与中层之间。绝大多数中高层概念由理解主导迁移,仅极少量底层概念中生成对理解有较大帮助。语言预训练对视觉理解的先验迁移效果显著,尤其在文本到图像生成中,语言能力大幅提升了模型对复杂提示的理解与精确生成能力。
(来源:韩俊霖)
未来展望:视频 Scaling 与世界模型
对于像素建模与世界建模的差异,韩俊霖认为,世界建模介于生成与理解之间,更偏向理解任务。随着规模扩大,生成对理解的反向促进可能出现涌现。在具身智能领域,统一模型与世界动作模型(WAM)均依赖大量视觉生成数据,预训练规模的提升将有助于机器人预测下一状态帧,从而优化操作能力。
针对数据耗尽的担忧,语言数据虽接近极限,但可通过合成数据与重复利用延续;视频数据则仍处于蓝海阶段。未来研究重点将转向视频与其他模态的结合架构。韩俊霖透露,其即将离开 Meta,专注于视频 Scaling 及多模态融合研究,以探索智能演进的下一阶段。
(来源:arXiv)
行业启示:打破基准测试依赖,回归原生训练
该研究对行业的启示在于:首先,应尽早开展原生多模态训练,避免后期对齐带来的性能损失;其次,需突破单纯依赖 Benchmark 的评价体系,关注模型内在机制与可迁移原则。虽然英伟达 Cosmos 3 等新架构尝试融合更多模态,但“语言主导、理解次之、生成最少”的数据配比原则仍具备较强的可迁移性。
韩俊霖强调,小样本学习无法替代大规模预训练建立的通用底座。未来的高效路径是在规模化预训练基础上,辅以高质量后训练数据。研究者应脱离“刷榜”思维,致力于寻找更具原则性、可扩展的底层规律,推动多模态大模型从经验驱动走向科学驱动。

