本文作者|夏千斯
本文编辑|张意梅
论文题目:Visual prompt engineering for video models
作者:Robert Geirhos,Yuxuan Li,Thaddäus Wiedemer 等(Google DeepMind)
提示工程(Prompt Engineering)已成为提升语言模型性能的关键手段。业界共识认为,只要模型输入空间足够丰富,便存在通过优化输入来提升下游任务表现的机会。
这一原理是否仅适用于语言模型,还是能推广至视觉领域?Google DeepMind 最新提出的“视觉提示工程”(Visual Prompt Engineering,VIPE)给出了肯定答案。该研究成功将提示工程扩展至视觉模态,实验显示,该方法能在多个任务上显著提升视频模型的推理性能,且在某些场景下比传统的文本提示工程或测试时扩展(Test-time Scaling)更为有效。
研究团队指出,视觉提示工程代表了一种新范式:视觉提示本身可以像文本提示一样被优化。随着多模态上下文能力的增强,该技术有望从单张图像编辑扩展至多参考图甚至视频处理。
视觉提示工程:在新的视觉场景中处理同一问题
视觉提示工程是一种针对视频模型视觉输入的优化方法。其核心在于不改变任务逻辑的前提下,将原始图像转换为模型更易理解和推理的视觉形式,使模型能在全新的视觉场景中处理同一问题。例如,将抽象的球与斜坡示意图转换为写实的台球与木板场景,同时保持关键空间关系一致。
图|视觉提示工程从一个视觉提示开始,例如一张球和斜坡的草图图像,以及相应的文本提示。
具体实施流程包含三个关键环节:
- 构想器(Conceiver):负责生成图像修改策略。它基于任务样本和约束条件,输出自然语言编辑指令,明确需保留的任务相关元素(如物体数量、位置、朝向及相对关系)。
- 编辑器(Editor):执行图像修改。根据指令利用图像编辑模型或人工方式,生成一个或多个候选图像。
- 筛选器(Filter):(可选步骤)当存在多个候选图时,从中优选质量更高且完整保留任务关键信息的版本。
比文本指令更有效
研究团队在 VPCT 物理推理任务上验证了自动化视觉提示工程的效果。结果表明,优化视觉上下文通常比优化文本指令更能驱动性能提升。
真正驱动性能提升的是视觉真实感
应用视觉提示工程后,Veo 3.1 模型的准确率从 41.3% 提升至 59.3%,Omni Flash 从 56.3% 提升至 67.5%。数据显示,视频模型系统性地偏好照片级真实的上下文,而非抽象输入。
图|视觉提示工程提升了 VPCT 上的物理推理能力。
既可以自动化,也能作为有效的测试时扩展策略
视觉提示工程的自动化流程由视觉 - 语言模型(VLM)生成改写指令,图像编辑模型生成候选图,并由自动评分器进行筛选或反馈迭代。研究对比了“自由形式构想”和“原子概念编辑(ACE)”两种路径,发现两者均能自动生成更优的改写图像。
其中,自由形式视觉提示工程在部分任务上将错误率降低了超过 75%;而在 Sort 3 Numbers 任务中,若采用 ACE 并按样本选择最佳视觉版本,错误率可降为 0。
图|自动化视觉提示工程在多种任务上都能提升性能。
在小球滚落物理推理任务中,未使用该技术时,Veo 3.1 需通过多次采样才能将准确率从 41.3% 提升至 50.0%;而加入视觉提示工程后,单次采样准确率即达 59.3%。若在此基础上结合多次采样,准确率可进一步攀升至 68.0%。
图|视觉提示工程还可以与测试时扩展结合,进一步提升性能。
优化视觉上下文往往比优化文本指令更有效
以 Sort 3 Numbers 任务为例,最优文本提示的准确率为 86%,而最优图像提示的准确率为 76%。尽管文本提示上限略高,但在视频模型的实际应用中,视觉提示工程往往展现出更强的鲁棒性和通用性。
图|对于视频模型而言,视觉提示工程可能比文本提示工程更有效。
没有系统性提升原生图像生成模型的推理表现
值得注意的是,该方法对 Nano BananaPro、Nano Banana 2 等原生图像生成模型并未带来稳定的性能提升。这可能是因为此类模型训练数据覆盖了广泛的视觉风格,对抽象草图和真实图像均具备较强的理解能力,因此对输入形式的敏感度较低。
图|原生图像生成模型在 VPCT 上的结果,报告每种配置下的最佳提示结果。
有效的图像改写通常具备三类特征
研究发现,高效的图像改写通常具备以下特征:场景更真实、目标更突出、语义更直接。这类改写缩短了抽象输入与视频模型熟悉视觉表征之间的差距。例如在 VPCT 任务中,将草图转为照片级真实场景后,Veo 3.1 准确率显著提升。因此,当任务允许时,优先使用真实场景版本的视觉提示是更佳策略。
图|向真实感迈出的每一步都会提升生成一致性。
局限性与未来展望
当前方法仍存在一定局限性。首先,其效果高度依赖图像编辑模型的质量。若编辑过程改变了任务关键信息或引入伪影,可能导致下游视频模型推理失败。未来随着编辑模型稳定性的提升,额外的筛选和质量控制环节或将不再必要。
其次,视觉提示工程会引入额外成本。然而,鉴于图像编辑的成本远低于视频生成,这一投入在实践中具有极高的性价比:一次低成本的图像编辑调用,可显著降低昂贵视频生成失败的概率,从而在整体上节省资源。

