编辑丨吴思梦 岑峰

01
多模态信息交互金字塔
02
模型架构、数据组织与训练策略
03
实验结果
04
总述
以下为AI 科技评论与Gestalt 团队对话实录:
▎AI 科技评论:第一个问题想从名字开始。模型为什么叫 Gestalt?
▎AI 科技评论:你们是怎么认识到多模态信息交互的重要性的?
▎AI 科技评论:论文 Figure 1 里有一个大小狗的例子:文字告诉模型“大狗戴红项圈,小狗戴蓝项圈”,但图片里只有一只狗。模型必须把文字里的大小关系和图片里的颜色信息结合起来才能答对。这个例子是你们专门设计的吗?
▎AI 科技评论:现在的多模态模型已经可以看图、读文字、生成图像。你们所说的多模态智能,和现在常见的“视觉能力+语言能力”,最本质的区别是什么?
▎AI 科技评论:论文提出了“冗余、视觉独特、文本独特、协同”四类信息。为什么处在金字塔最上层的是协同信息?你们希望模型从这种协同信息里获得的,是一种新的推理能力,还是一种只有多种模态放在一起才会涌现的信息?
▎AI 科技评论:论文里用了一个很有意思的说法,more is different。“模态更多”之后,到底会多出什么东西?有没有一个实验结果,让你们真正觉得这已经不是视觉能力和语言能力简单相加了?
▎AI 科技评论:为什么不让视觉和文本从一开始就充分融合,而是先把它们分开,再通过 interplay token 进行交互?你们是不是认为,多模态模型的问题有时候不是“交流得不够多”,反而是“交流得太多”?
▎AI 科技评论:你们把 Zone I 设置成前四层,又用了 32 个 interplay token。为什么最后是这两个数字?如果把四层改成十几层,或者把 32 个 token 换成更多、更少,会发生什么?
▎AI 科技评论:Figure 6 里有个很有意思的现象:不同任务下,interplay token 已经表现出了不同的交互模式。既然模型能够感知任务的信息需求,为什么前四层还要人为规定分开?未来能不能让模型自己决定什么时候交互、交互多少?
▎AI 科技评论:PPT 里特别强调了一点,没有进行强化学习。为什么这件事值得被单独强调?你们觉得 RL 会成为 Gestalt 下一阶段值得探索的方向吗?如果加入 RL,你们最希望它解决什么问题?
▎AI 科技评论:到目前为止,Gestalt 还有什么问题是没有解决的?
▎AI 科技评论:最后一个问题稍微大胆一点。如果三年以后回头看,发现“按需组织不同模态之间的信息交换”这条路并不是正确答案,你们觉得最可能错在哪里?是我们对多模态智能的理解错了,还是现在这套架构只是一个过渡?

