题目:The Invisible Hand of Physics: When Video Diffusion Models Know More Than They Show
论文地址:https://arxiv.org/abs/2606.05328
创新点
•方法层面的创新:作者提出了一种全新的探针分析框架 —— 不满足于对生成结果或编码器特征做表面检测,而是把干净视频的潜变量沿学习到的速度场反向积分回噪声空间,近似反转确定性采样过程,从而沿 "噪声到视频" 的反向轨迹逐模块、逐时间步地收集扩散模型的内部激活并施加线性探针,这为研究生成式模型的内在表征提供了新工具。
•核心发现的创新:物理合理性信号可以在扩散 Transformer 的内部状态中被线性解码,而这一信号并不存在于 VAE 编码器输出的潜变量输入中,而是在去噪过程内部自发涌现 —— 尽管模型从未使用任何自监督预测目标进行训练,这与 V-JEPA 等自监督表征模型 "由预测目标塑造表征" 的结论形成本质区别,直接表明生成式去噪本身即可催生物理表征,物理理解是生成任务的副产物而非训练目标。
方法
本文的主要研究方法是一条 "深入内部 — 读出信号 — 因果验证" 的技术路线。首先,作者采用反向采样获取模型内部轨迹:将干净视频潜变量沿扩散模型学习到的速度场反向积分回噪声空间,近似反转确定性采样过程,并沿该轨迹在每个模块和时间步记录内部激活。其次,在这些内部状态上训练线性探针,对 "合理 / 不合理" 视频做分类,并辅以成对评估协议与表征编码器基线对比;随后把方法从分类延伸到回归,用线性回归器从内部状态连续预测场景的定量物理参数(如抛体轨迹的初始位置与初始速度)。最后,通过模块级噪声干预做因果定位:对选定模块的激活注入噪声后重新生成视频并重新探针打分,据 "惊奇度" 变化判断哪些模块对物理合理性负有因果责任,另以 t-SNE 投影等分析辅助对照。整条路线层层递进,证明物理合理性并非来自编码器输入或监督目标,而是在去噪计算中自发涌现并被内部状态携带 。
反向采样与物理合理性探针:将干净视频潜变量沿速度场反向积分至噪声,并在轨迹各模块与时间步上记录内部激活,用探针预测物理合理性
本图的核心流程是:左侧展示扩散模型的正向采样方向,右侧展示反向采样方向,二者共用速度场微分方程描述的去噪过程;作者的关键操作是沿学习到的速度场把干净视频的潜变量逆向积分回噪声空间,从而近似反转确定性采样过程,并在这条反向轨迹的每一个模块和时间步上收集模型的内部激活;随后由探针(Probe)对这些内部状态进行判定,区分物理合理(Plausible)与物理不合理(Implausible)的视频。图的要义在于,作者不依赖任何外部监督或生成结果表面的判断,而是直接深入去噪过程的内部状态,检验物理规律的表征是否在其中自发涌现,这正是全文论证 "物理理解是生成式去噪副产物" 的方法起点 。
物理合理性可从视频扩散模型的内部状态中被解码:多个视频扩散模型的探针准确率与表征编码器对比,结果显示扩散视频模型平均表现更优
本图这是一张分组柱状图,纵轴为逐视频的物理合理性判定准确率,横轴按物理属性类别分组,覆盖两个物理推理基准下的恒存性、形状一致性、连续性、重力、固体性等各类违背物理规律的场景,图中以红色虚线标出随机水平作为基准线;不同颜色的柱子代表不同的模型 —— 包括多个视频扩散模型、两种专为表征学习设计的对比基线,以及直接探测编码器输出的对照结果,右侧还用一块区域概括扩散模型家族的整体表现。图的核心结论是:从视频扩散模型去噪内部状态中训练的探针,其准确率普遍明显高于随机水平,并达到甚至超过专门训练的表征编码器,而直接探测编码器潜变量则始终停留在随机水平 —— 这直观表明物理合理性信号并非来自编码器的结构化输入表示,而是在去噪过程内部自发涌现,从而支撑了 "生成式去噪本身即可催生物理表征" 这一全文核心发现。
IntPhys 与 InfLevel 上的成对准确率:按照既有评估协议,向探针同时展示 "物理合理 / 不合理" 的一对视频,要求其判断哪一个是物理上不可能的;扩散模型始终超过 V-JEPA 与 VideoMAE-Large,印证了图 2 的逐视频结果
本图是一张柱状图,纵轴为成对准确率(Pair-wise accuracy),横轴按物理属性类别分组排列,覆盖两个物理推理基准下的不同违背物理规律的场景,图中以灰色柱和标注标出随机水平作为对照基线,其余各色柱子分别代表不同的视频扩散模型与表征学习基线。图的核心信息是:与图 2 中 "逐条视频单独判定" 的更难设定不同,本图采用成对比较的设定 —— 把物理合理与不合理的一对视频同时呈现给探针,让它选出其中不可能的那个;在这种设定下,所有视频扩散模型的表现都稳定超过两种专用表征编码器,并与图 2 的逐视频结论相互印证,从而进一步巩固了 "物理合理性信号确实能从扩散模型内部状态中被读出" 这一核心发现 。
扩散模型的内部状态编码定量的场景参数:对每个模型在所有 Transformer 块上训练线性回归器,用以预测抛物线球轨迹的初始位置(上排)与初始速度(下排),并展示表现最佳的模块
本图由上下两行、每行五个子图构成,五列分别对应三个视频扩散模型与两个表征学习基线;上排子图用 "预测值对真实值" 的散点图检验模型内部状态对球体初始位置的回归能力,下排子图则检验对初始速度的回归能力,每个子图中散点越贴近对角线说明预测越准确,并标注出各模型表现最佳的 Transformer 块。图的核心结论是:物理合理性不仅能够被线性探针以分类方式读出,还能以回归方式量化 —— 从扩散模型的去噪内部状态中,可以连续地解码出场景的定量物理参数(如抛体轨迹的初始位置与初始速度),且其回归精度与专为表征学习设计的编码器相当;这进一步表明扩散模型内部携带的并非粗糙的 "合理 / 不合理" 二分类信号,而是更精细、可量化的物理量表示 。

