导读多模态模型让 Agent 能接收图片、音频、视频、界面和传感器信息,但这不只是多了几个输入类型。真正变化的是:环境状态如何被感知,哪些信息进入记忆,规划怎样绑定到具体对象,动作之后又怎样用新的观察纠错。沿着这条闭环,才能看懂三种多模态感知路线各自的价值与边界。
多模态 Agent 缺的不是“眼睛”,而是能回到行动里的感知
“给 Agent 接上视觉”,听起来像给语言模型装一双眼睛:它能读截图、看摄像头,回答自然会更准确。可一旦任务不是描述画面,而是完成事情,这个说法就不够了。
想象一个简单任务:让机器人把桌上的杯子移到托盘上。它要确认杯子的位置和遮挡,把状态与目标放在一起决定动作;执行后再观察杯子有没有滑动、是否放稳。任何一环只输出一段漂亮的文字,都不等于任务完成。
因此,多模态带来的不是“模型知道得更多”,而是让原本在文本之外的环境状态,能够参与下一步决策。本文借用一篇于 2026 年 6 月 28 日公开、目前已被 TMLR 接收的综述,把这个变化拆成感知、编排和行动三层。它不是唯一的 Agent 定义,却是一张实用的检查表:当一个系统宣称自己是多模态 Agent 时,我们可以追问它到底感知了什么、如何使用、又如何验证。
论文资料
论文: https://arxiv.org/abs/2608.20379
先把闭环拆开:感知、编排、行动各自负责什么
综述把多模态 Agent 组织为三个相互连接的部分。
感知层(Perception)负责把环境中的信号变成系统可用的信息。它的输入可以是文本、图像、音频、视频、网页界面,也可以是机器人传感器读数。关键不在于“收进来”,而在于这些信号是否保留了后续决策需要的空间、时间或状态信息。
编排层(Orchestrator)是把观察变成下一步动作的中枢。它包含推理、规划和记忆:推理解释当前状态,规划把目标拆成步骤,记忆保存任务已经发生过什么,以及哪些状态不能在下一轮丢掉。它不是一个与多模态无关的“文字大脑”;如果感知层给它的是模糊摘要,或者记忆只留下文字而抹掉关键视觉状态,它的计划也会失去落点。
行动层(Action)则通过工具调用、网页操作、多媒体编辑或具身控制影响环境。动作改变环境后,新的观察必须再回到感知层。这个回路才是 Agent 与单次多模态问答的分界:前者需要用结果修正下一步,后者只需生成一次答案。
图片说明:论文将多模态 Agent 组织为感知、编排与行动三部分,并强调三者与环境构成循环。图片来源:A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks,Figure 1
同一个多模态 Agent 可以面对文本、虚拟或物理环境,行动也可以是 API 调用、界面操作或机器人动作。它们共用闭环骨架,却不共用失败标准:网页点错按钮、视频漏掉事件、机械臂抓空,不能用一个笼统的“模型准确率”盖过去。
三条感知路线,区别不在谁更高级
多模态信息怎样进入编排层,决定了系统在哪一处保留细节、承担成本和暴露风险。综述将路线归为三类;这是用来分析系统设计的分类,不是从低到高的能力等级。
1. 委托式感知:先让工具看,再把结果交给语言模型
委托式感知(delegated perception)把图像、音频或视频交给专门工具处理,例如识别、检测、描述或生成工具;工具返回的结果通常会被转成文字,再由语言模型管理任务和规划。
这条路线易于接入,也更容易追踪“哪一步看到了什么”。但工具产出的描述会替代原始信号:若任务依赖精确坐标、细微变化或跨帧关系,一句摘要就可能让规划失去依据。它适合边界明确、专用工具可覆盖的感知任务。
2. 后期融合:各模态先编码,再接入语言模型
后期融合(late fusion)让图像、视频、音频等模态先经过各自的编码器,形成表示后再接入语言模型的表示空间。与委托式路线相比,它不必把所有非文本信息先改写成自然语言,因此可以保留更多由模态编码器提取的特征。
代价是不同编码器、投影模块与语言模型需要适配,训练和领域定制也会成为工程的一部分。它适合明确知道哪些模态需要稳定处理、又不希望所有任务都交由统一大模型重做的场景。
3. 早期融合:让统一模型更早地处理跨模态输入
早期融合(early fusion)由统一多模态模型在更早阶段处理图像、视频、音频与文本。它的吸引力在于,模型有机会在同一个表示空间里直接建立跨模态关系,而不是先依赖某一个工具的文字转述。
但“更早融合”并不自动意味着更可靠。原始或近原始的多模态输入会带来更高的训练、推理和上下文管理压力;当任务很长、视频很多或环境不断变化时,系统仍要决定哪些内容保留、哪些内容检索、哪些内容重新感知。
图片说明:从左到右分别是委托式、后期融合和早期融合感知;差异在于多模态信息在哪一步被转换和合并。图片来源:A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks,Figure 2
一个实用的判断方式是:不要先问“要不要上多模态大模型”,而是先问下一步决策依赖什么。若只需稳定读出一个固定信号,外部工具和明确结构可能更合适;若规划反复依赖视觉、时间或声音中的细节,过早把它们压缩成文字就会制造信息缺口。路线选择的核心是信息应在何处被压缩、何处被保留,而不是模型名字是否更新。
记忆不是聊天记录:它必须保存能改变下一步行动的状态
文本 Agent 的记忆常被理解为对话摘要、历史任务和知识检索。多模态场景下,这些当然仍然重要,但不够。
回到“移动杯子”的例子:如果系统只记得“已经尝试抓取一次”,它并不知道杯子被遮住、已经移动,还是夹爪角度不对。下一轮行动需要的,可能是关键帧、对象位置、时间顺序、置信信息或可检索的状态结构。
这不意味着把所有视频帧、截图和传感器数据永久塞进上下文。图像和视频会推高编码与推理负担,长任务还会淹没早期状态。真正的问题是取舍:哪些细节丢失后会让下一步失去依据,哪些可压缩,哪些应在需要时重新观察。
动作空间变了,评测也不能只看最终答案
当 Agent 的输出只是文本,评测往往可以围绕答案是否正确展开。可一旦输出变成点击、拖拽、调用接口、编辑内容或机器人控制,最终答案就只是结果的一部分。
网页 Agent 要处理页面布局、动态元素和操作后的状态变化;机器人 Agent 还要面对执行误差、传感噪声与安全约束;长视频任务则需要在时间跨度中定位事件,并避免把局部片段当成全局结论。综述据此提醒:不同应用中的性能、延迟、可扩展性和鲁棒性不能脱离环境与动作空间讨论。
这也是为什么“模型看图得分高”并不能直接推出“它能可靠完成 GUI 或机器人任务”。前者也许证明某个视觉理解口径下的表现;后者还要经过定位、状态追踪、动作执行、反馈校验和失败恢复。两者之间隔着一条完整的系统链路。
最后把问题落回工程:闭环在哪里断了?
多模态 Agent 的价值,最终不该用“支持多少模态”来概括。评估一个系统时,更值得逐项检查:
1. 环境状态是否被准确感知?
2. 关键信息能否在规划时被取回?
3. 动作是否真正作用到目标?
4. 动作结果是否会形成下一轮可用反馈?
如果这四个问题中有一个回答不清,多模态可能只是一个更丰富的输入界面,而不是更可靠的 Agent。反过来,哪怕系统只处理图像和文本两种模态,只要它能把观察、决策、执行和纠错接起来,也已经在解决多模态 Agent 最难的部分。
所以,“模型能不能看见”只是起点。真正决定系统能否进入复杂任务的,是它有没有把看见的东西变成可验证、可回到行动里的闭环。
参考资料
A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications: https://arxiv.org/abs/2608.20379
— THE END —
文章仅做学术分享,如有侵权请联系删除,非常感谢!

