大数跨境

多模态 AI 下一战:酒杯倒了,人为什么还想看下去?| 对话 ECCV 2026 MARS2 发起方钛动科技

多模态 AI 下一战:酒杯倒了,人为什么还想看下去?| 对话 ECCV 2026 MARS2 发起方钛动科技 AI科技评论
2026-09-18
2
导读:AI会“看”广告了,但离理解消费者意图和 Agentic Commerce 还有距离。
AI 已具备“看”广告的基础能力,但在理解消费者深层意图及迈向 Agentic Commerce(代理商业)方面仍存显著差距。

    作者丨李秋悦

    编辑丨吴   彤

婚礼现场,酒杯堆成的小山突然倒塌。多模态模型能准确描述“婚礼、酒杯、倒塌”等事实,甚至推测是震动所致。但人类观众的反应往往更复杂:对意外的好奇、对美好场景被破坏的不适、对赔偿成本的担忧。这些基于生活经验的潜意识联想,构成了人类继续观看的动力。
这是 ECCV MARS2 Workshop 2026 挑战赛双冠团队"The Boys"在复盘中举出的典型案例,揭示了当前 AI 与人类认知的核心差异。
The Boys 团队在 ECCV 分享技术方案。成员包括来自字节跳动的刘博元、孙腾豪、谢子凡、邢佳豪
9 月 9 日,由钛动科技牵头发起的 MARS2 Workshop 在瑞典马尔默举行的欧洲计算机视觉大会(ECCV 2026)期间举办。MARS2 全称为"Multimodal Reasoning and Slow Thinking in the Large Model Era",旨在探讨多模态大模型在识别物体、文字与场景之后,能否进一步对复杂的时间关系、因果关系及抽象意图进行推理,推动模型从传统感知任务走向更复杂的"System 2"式推理。
本次赛事于 6 月至 8 月通过 EvalAI 进行,基于包含 3000 余条视频、9000 余组问答的数据集展开。与 2025 年 ICCV 首届赛事仅有一条广告赛道不同,2026 年的三条赛道全部聚焦广告与营销领域:
MAC:考察 AI 对广告整体内容的理解能力;
VTG:要求模型定位支撑判断的关键证据在视频中的具体时间点;
MDC:深入追问广告的创意策略,包括注意力捕捉方式、品牌植入逻辑及试图触发的消费者心理。
竞赛团队背景分布图
赛事吸引了全球 64 支团队参赛,累计提交超 1060 份方案,参赛者涵盖中科大、南开大学等高校及字节跳动、京东、小红书等企业。最终,字节跳动背景的 The Boys 团队斩获 MAC、MDC 双冠军及 VTG 亚军。
本次赛事引发了行业对三个核心问题的思考:广告为何成为测试多模态推理的新场景?高阶推理缺失的是更大模型还是更完整的证据链?AI 距离真正理解消费者并进入 Agentic Commerce 还有多远?以下是 AI 科技评论与出题方钛动科技技术 VP Tracy Chen 及解题冠军 The Boys 团队的深度对话。

01 谁在出题:产业公司进入学术顶会

AI 科技评论:钛动此次作为主办方,是如何进入 MARS2 的?
Tracy Chen:合作始于业务需求。钛极 VL(钛动自研内容理解模型)在优化广告营销理解时,需要合适的 Benchmark。通过 AdsQA 团队引荐,我们发现双方目标高度契合:学术界希望研究真实复杂的多模态慢思考与多跳推理,而钛动拥有大量来自出海品牌一线的真实场景与问题。合作并非为了办比赛而办比赛,而是基于具体问题与数据讨论,最终共同设计 Challenge,践行"Useful AI"理念。
AI 科技评论:作为主办方,钛动具体做了什么?
Tracy Chen:我们深度参与了会议组织与赛题设计。首先是将模糊的产业问题拆解为可定义、可标注的研究任务;其次制定数据脱敏、任务边界及标注标准;最后负责评测设计及技术支持。我们不仅提供广告视频,更将时间关系、跨模态证据、品牌植入和创意策略等真实难点融入赛题。
AI 科技评论:为何今年三条赛道全部围绕广告展开?
Tracy Chen:2025 年的 VR-Ads 证明了广告是多模态推理的潜力场景。今年我们将问题细化,分别考察内容理解、证据定位和策略推理。广告兼具画面、声音等显性信息与注意力引导、情绪变化等隐性信息。模型不仅要“看到什么”,更要找到支撑判断的证据并解释“为什么”。
AI 科技评论:相比机器人或医疗,为何偏偏选择广告?
Tracy Chen:广告同时包含事实信息与意图信息。画面内容是事实,但镜头语言、音乐选择、品牌露出时机则涉及创意意图与消费者心理。且广告是完整的时间序列,需串联前后镜头、配音及字幕才能理解完整的创意逻辑。
AI 科技评论:The Boys 团队认为广告最难的部分是什么?
The Boys:最难的是心理层面的引导。如婚礼酒杯倒塌案例,人类会联想到“意外”、“赔偿”、“难收拾”等生活经验,从而驱动观看。AI 缺乏这种基于真实生活的先验知识,难以解释为何某些解压视频能引发舒适感。
AI 科技评论:MAC 和 MDC 赛道的本质区别是什么?
The Boys:MAC 偏向客观事实描述(发生了什么),MDC 偏向主观策略分析(品牌如何植入、为何吸引注意、触发何种心理)。后者不仅需要识别事实,更需解读意图。
AI 科技评论:“消费者心理”没有唯一答案,如何评分?
Tracy Chen:我们不假设单一标准答案。做法是先标注可观察的事实证据,再标注基于证据的策略解释,并记录不同标注者间的共识与分歧。对于创意意图等主观问题,通过多标注者、多模型及专家仲裁,区分事实判断与解释判断。
钛动科技技术 VP Tracy Chen 在 ECCV 介绍赛事

02 怎么解题:先让模型看到正确的证据

AI 科技评论:当前多模态推理的最大瓶颈是什么?是模型不够聪明,还是信息未进入模型?
Tracy Chen:最大瓶颈在于信息获取、整合与验证尚未形成闭环。若关键文字未被识别、声音未被解析或时间关系丢失,推理便建立在残缺信息之上。未来重点不仅是让模型“想得更久”,更要让其“看得更准、找得更主动、验证更充分”。
AI 科技评论:The Boys 团队在三条赛道具体采用了什么策略?
The Boys:我们对 MAC 和 MDC 采用统一预处理方案(分镜、ASR 翻译、逐分镜理解后汇总),而 VTG 因参数量限制及对分镜敏感度不同,单独搭建了一套方案。
AI 科技评论:实验是否发现增加音频等证据比单纯扩大模型更有效?
The Boys:是的。传统 VLM 多依赖抽帧和文本,补充音频信息提升明显。OCR 未单独做,以免环境文字干扰。时间轴处理上,我们采用切分镜方法,将长视频拆分为小片段分别理解再整合,有效降低了细节遗漏和模型幻觉。多模态推理的瓶颈在于如何管理有限上下文,将分散信息整理清晰,这在一定程度上弥补了模型能力的不足。
AI 科技评论:如何防止模型利用营销常识“编故事”而非真正理解广告?
The Boys:针对大模型幻觉,我们对视频进行了充分的结构化预处理(分镜、理解、翻译),并要求模型回答时必须基于结构化结果举证,再利用另一个模型判定举证的正确性。
AI 科技评论:Proposer-Critic 等方法是否是关键?
The Boys:我们使用了 Proposer-Critic 和 coarse-to-fine 策略。此外,“分镜 - 逐段理解 - 整合”这一简单有效的方法至关重要,既降低了幻觉,也减少了小参数模型在长视频理解中的细节丢失。
AI 科技评论:下一阶段 System 2 的重点是否应转向“何时重看、去哪找证据”?
The Boys:对小参数模型而言,单纯增加思考预算可能导致原地打转。让模型具备重新检索证据、自我怀疑的能力,更接近 Agent 的工具调用与上下文管理,这比一味“想得更久”更有效。
AI 科技评论:是否意味着模型做大不再重要?
Tracy Chen:不能如此绝对。在特定任务范围内,输入信息的质量和组织方式可能比有限的参数增加更重要。一个拥有完整证据的 4B 模型可能优于面对混乱输入的 8B 模型。但这不代表 Scaling 失效,更大模型仍影响复杂推理与泛化。未来应关注“联合 Scaling",即模型规模、数据质量、上下文长度及工具调用的协同分配。
AI 科技评论:单一基础模型排行榜是否已过时?
Tracy Chen:对于具体应用,单一排行榜不足以代表系统能力。真实业务看重的是包含 OCR、ASR、时间建模及验证机制在内的整套系统表现。未来评估标准将从“哪个模型分数最高”转向“哪个系统在真实任务中完成得最好”。
钛动科技技术 VP Tracy Chen (右 2)和钛动科技团队在 ECCV

03 题外之谈:离真正的 Agentic Commerce 还有距离

AI 科技评论:Agentic Commerce 与传统营销自动化的本质区别是什么?
Tracy Chen:传统自动化多按预设规则执行,而 Agentic Commerce 参与完整决策链。它需理解用户、内容、场景及意图,并对行动结果负责。Agent 不仅是执行者,更是决策者,需解决可追溯、可解释及风险控制等问题。广告理解因此升级为智能体商业的核心能力。
AI 科技评论:如何定义 Agentic Commerce?
Tracy Chen:关键在于能否围绕目标自主完成连续任务。从理解需求、搜索比较,到调用工具、调整判断,直至完成交易。成熟的 Agent 是在约束条件下高效完成任务,而非无边界行动。
AI 科技评论:从 MARS2 测试的认知基础到真正替消费者花钱,中间最大的鸿沟是什么?
Tracy Chen:越接近交易环节,对权限、资金安全及责任归属的要求越高。目前 MARS2 测试的是“理解—证据—推理”的认知基础。走向真实交易还需解决用户授权管理、不确定性表达、错误回滚及合规归因等难题。
The Boys:最大鸿沟仍在心理层面。感知用户痛点、预判转化策略及维持用户耐心,比单纯看懂内容难得多。
AI 科技评论:若将比赛方案直接投入业务,最先暴露的问题是什么?
Tracy Chen:真实环境更复杂,试错成本更高。比赛答错仅扣分,实业答错则浪费预算甚至引发合规风险。方案需经真实场景验证、成本测试及灰度发布,比赛更多是指明技术方向。
The Boys:首先是语种与文化适配问题。不同地区的生活习惯与软硬件环境差异巨大,数据“水土不服”会导致转化行为差异。此外,素材表现很大程度上是后验的,内容推断只能保证下限,无法决定上限。
AI 科技评论:若设计 MARS2 2027 新题,最想测试什么?
The Boys:建议聚焦时间与空间维度的用户偏好预测。例如:广告在第几秒被划走或转化的概率更高?两张图片中用户更可能点击哪一张?若模型能拟合人类兴趣点并给出合理理由,将真正反哺素材生产与投放策略。
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8961
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读247.8k
粉丝0
内容9.0k