AI VIDEO · PAPER 2026.07
会生成视频=理解世界?
生成未来 ≠ 理解世界
一场因果推理大考
CGDJ · 世界模型 · 视频因果推理
Thinking in Video
📦 6 Parts + Conclusion
👉 滑动
PART 01
双重考法
拆穿伪推理
PART 03
实验结果
会演不等于会懂
PART 06
最新路线
五种技术方向
PART ///
写在最后
理解世界还差什么
这两年,视频生成模型被赋予了一个越来越宏大的名字: 世界模型 。理由听起来很顺——如果模型能根据当前画面生成下一秒、下十秒,甚至几分钟后的世界,它似乎就已经学会了物理规律、社会常识和因果关系。
但问题也恰恰藏在这里。玻璃掉在地上碎了,模型可能真的理解了 重力、碰撞和材料强度 ,也可能只是看过太多“玻璃落地”的视频,熟练地复刻了最常见的画面。
2026 年 7 月 20 日,中南大学、腾讯和清华大学的研究团队上传了一篇新论文:《Thinking in Video:Can Video Generators Really Reason About the Real World?》。论文没有继续比谁的视频更清晰,而是换了一个更尖锐的问题: 视频模型到底在推理,还是只是在表演推理?
论文编号: arXiv 2607.17523 ,可在 arXiv 搜索该编号下载原文。
先说结论:Sora-2、Veo-3.1 等闭源模型已经出现了有限的因果理解能力,但距离可靠的“世界模拟器”仍然很远;Wan-2.2、HunyuanVideo-1.5 等开源模型则出现了一个更反常的现象—— 它们几乎答不出因果问题 ,却能生成看起来还算合理的因果结果。
这篇论文真正有价值的地方,不是给模型排了一张榜单,而是揭开了视频生成领域长期被画质掩盖的一条裂缝: 会生成,不等于会理解;会说对,也不等于做得到 。
01
PART
视频不只是输出,它也可以成为“思维”
PARADIGM
过去我们把视频生成理解为一个单向过程:输入提示词,模型输出视频。论文把这个概念重新命名为 Thinking in Video ——视频不再只是答案的包装,而是模型构造、延伸和验证因果思维的介质。
这和人类做“脑内模拟”很像。看到杯子被推到桌边,我们不仅会说“它可能掉下去”,还会在脑中预演杯子下落、碰撞、破碎或反弹的连续过程。 真正的世界模型 ,应该既知道会发生什么,也能把中间状态稳定地推演出来。
— 论文图 1:CGDJ 总体框架,图片直接截取自论文
为了检验这种能力,研究团队提出了 Causal-Generative Dual-Judge ,简称 CGDJ。它像两位分工不同的考官,一位考“你看懂了吗”,另一位考“你做得出来吗”。
第一位考官测试 显式因果感知 。模型需要读懂视频中的时间关系和问题,并在生成的视频里给出正确答案;第二位考官测试 隐式生成预测 ,模型只看到关键事件发生前的画面,必须生成符合真实因果的后续视频。
「两条测试链一拆开,模型是在理解因果,还是只会沿着高频视觉模式继续生成,就不再那么容易混在一起。」
02
PART
把时间“摊平”,塞进一张图
METHOD
这篇论文最巧妙、也最值得争议的技术,是 Flatten Temporal Video 。因为许多视频生成模型不能直接处理“视频+文字问题”的交错输入,研究团队干脆把时间维度摊平成空间维度。
在显式因果测试中,他们从视频里均匀抽取 70 帧 ,排成 7×10 的网格,再把问题和选项渲染成图片,拼到网格上方。最终,整段视频和一道选择题被压缩成一张 1280×720 的复合图,送进视频生成模型。
在隐式生成测试中,研究人员先人工标出 “因果拐点” ——也就是条件积累到足以触发结果的那一刻。拐点之前的 7 张关键帧作为输入,拐点之后的真实视频作为 Gold Video,模型生成的未来则与真实未来逐项比较。
— 论文图 2:显式理解与隐式预测数据的构建方法
显式测试用了 Video-MME 的 900 段视频 ,覆盖知识、生活记录、体育、表演、影视和多语言内容;隐式测试则包含 600 段视频 ,自然科学和社会人文各 300 段。
评分也不再依赖传统的 FVD 或“画面好不好看”。显式测试会用 Whisper 转写生成视频中的语音,再由 Gemini-3-Pro 同时检查画面、语音、原问题和标准答案;隐式测试则从 语义一致性、参考视频一致性和物理有效性 三个维度打分。
— 论文图 4:CGDJ 的双重评估流程
模型不能只生成一个顺滑、漂亮的镜头。它还必须让物体、动作和因果链条彼此对得上。
03
PART
最扎眼的结果:会演,不一定会懂
RESULTS
先看显式因果理解。Gemini-3-Flash 直接读取原视频时的平均准确率是 83.0%,视频被压成 7×10 网格后仍有 74.1%;GPT-5 则从 79.4%降到 67.6%。这说明 “把时间摊平”确实损失了信息 ,但并没有把因果线索全部毁掉。
真正的断层出现在视频生成模型上。Sora-2 的显式因果准确率为 51.2%,Veo-3.1 为 49.9%,大致接近一个 8B 级视觉语言模型;Wan-2.2 只有 0.7%,HunyuanVideo-1.5 也只有 1.5%, 几乎完全失效 。
— 论文表 2:显式因果理解结果,红色数字为同组最佳平均表现
如果只看这张表,结论似乎是开源视频模型根本不懂因果。但到了 “生成未来” 的测试中,事情突然反转。
Sora-2 仍然领先,隐式生成得分为 61.6%;Veo-3.1 为 58.9%。可与此同时,HunyuanVideo-1.5 达到 42.5%,Wan-2.2 也有 41.5%——它们明明几乎无法明确回答“为什么”,却可以生成一段中等水平的 “然后发生了什么” 。
— 论文表 3:隐式生成预测结果,Sora-2 平均得分最高
论文把这种现象称为 Perception-Prediction Gap ,也就是感知—预测鸿沟。以 Wan-2.2 为例,显式理解只有 0.7%,隐式生成却有 41.5%;这更像是模型学会了因果事件的“视觉纹理”,而不是掌握了可以解释、迁移和反事实推演的因果规律。
另一个细节也很有意思:模型普遍更擅长社会行为,而不是严格物理。Sora-2 在社会人文场景中得到 65.6%,自然科学只有 57.7%。相比守恒定律、材料变化和复杂力学, 人类行为中的高频套路 显然更容易被海量视频数据捕捉。
「模型可能学会了因果事件的视觉纹理,却没有掌握可以解释、迁移和反事实推演的因果规律。」
04
PART
更尴尬的是:嘴懂了,手却没学会
MISALIGNMENT
研究团队又把闭源模型的 音频答案和视频画面 拆开检查,发现了一种更直观的错位。
Veo-3.1 的 Video-Only 准确率为 39.6%,Audio-Only 却达到 49.4%;Sora-2 的 Video-Only 为 42.4%,Audio-Only 为 46.8%。也就是说,模型常常能在旁白里把因果逻辑说对,却无法在像素世界里把 正确结果画出来 。
— 论文图 5:音频理解与视频生成的错位
论文用了一个很形象的比喻: 理论专家,实践新手 。语言模块可能已经知道“水会逐渐装满杯子”“刀切木头会留下越来越深的槽”,但生成模块仍会让水位固定、木屑消失,或者让物体在中途突然改变身份。
为了验证自动评分是否可信,论文还让 3 位人类专家对 600 段生成结果盲评。Gemini-3-Pro 与人类平均评分的 Pearson 相关系数达到 0.8205 ,平均绝对差为 0.1468,说明自动评估至少能够较稳定地跟随人类判断。
研究团队还测试了“是不是给模型看越多帧越好”。结果恰恰相反:显式测试中, 7×10 网格的平均表现最好 ;压到 5×8 时长视频信息不足,挤到 8×12 时每个小格又太模糊。
— 论文图 7:不同时间网格的消融实验
隐式生成也出现同样的 倒 U 型曲线 。1 张、4 张关键帧无法消除运动歧义,10 张又带来信息冗余和空间压缩,7 张反而是最佳平衡点。
— 论文图 8:不同关键帧数量的生成表现
当前模型的瓶颈并不只是“看得不够多”,而是如何把有限分辨率里的时间信息组织成可推理的状态。
05
PART
这篇论文证明了什么,又没有证明什么
CRITIQUE
CGDJ 的最大贡献,是把 “理解”和“生成”拆开测 ,让视频模型不能再用画质掩盖因果错误。但如果把它直接当成“模型是否真正理解世界”的终极裁判,也会走得太远。
问题一:两条测试链并不在同一把尺子上
显式理解和隐式生成使用了不同数据集、不同任务,也使用了不同计分方式。前者是选择题准确率,后者是 0 到 1 的连续质量分;把 0.7%和 41.5%并排放在一起很醒目,却还不是 同一批样本上的严格内部一致性测量 。
问题二:低分也可能来自“不会考试”
Flatten Temporal Video 同时考验了 OCR、指令跟随、复合图片解析和因果推理。开源视频模型的接近零分,可能说明它们缺少 “看图答题”的对齐训练 ,却不能直接等价为内部完全没有物理知识。
问题三:预测未来,还不是反事实推理
从事件前半段预测后半段,仍然主要是观察性预测。真正的因果理解还要回答 “如果我改变一个条件,会发生什么” ,也就是干预和反事实;如果没有成对反事实样本,模型依然可能靠常见模式蒙对未来。
问题四:描述者和裁判来自同一个模型
论文让 Gemini-3-Pro 生成语义描述,又让它担任主要裁判;尽管人类评分验证缓解了顾虑,但描述是否只基于拐点前画面、是否提前泄露结果,论文还需要给出 更细的复现实验 。
更准确的结论
这篇论文揭示了当前视频模型的能力错位,但还没有最终证明模型内部究竟有没有可迁移的因果世界模型。它提出的是一套很有价值的诊断仪,而不是一张“是否拥有智能”的化验单。
06
PART
论文之外,最新技术正在往哪里走
FRONTIER
截至 2026 年 7 月,研究路线已经不再满足于继续放大视频模型。越来越多工作开始补上 规划、物理、状态、交互和反事实 这五块短板。
方向一:先规划物理过程,再调用视频模型
NEWTON 把视频生成从最终答案降级为智能体工具箱中的一个动作。一个可训练规划器会调用关键帧生成、科学计算和提示词修正工具,再由验证器检查结果并触发重新规划;它不修改底层生成器,就把 Veo-3.1 在 VideoPhy-2 上的联合准确率从 30.7%提高到 37.4% 。
VChain 走的是“视觉思维链”路线。多模态模型先推断一组 稀疏的关键视觉状态 ,再通过轻量 LoRA 在推理时把这些状态注入视频生成器,让模型不必从一句模糊提示词直接跳到最终像素。
这条路线的核心判断是:很多物理错误不是生成器完全没能力,而是输入提示把真实世界压缩得太厉害。与其要求一个模型凭空补齐所有条件,不如让系统先写出一份 可检查的“物理分镜” 。
方向二:把质量、力、深度直接教给模型
PhysAlign 用可控模拟器生成带 深度、质量、力和初始运动角度 标注的视频,再通过适配器把 3D 几何与时间运动特征对齐到现有 DiT 视频模型的潜空间。
这和“多看公开视频,自然悟出物理”完全不同。公开视频只告诉模型发生了什么,显式物理标注则进一步告诉它: 哪些变量导致了结果 ,以及变量改变后轨迹应该怎样改变。
方向三:别急着画像素,先学会预测状态
V-JEPA 2.1 不把重建每个像素当成主要目标,而是在潜在表示空间预测未来。它通过密集预测损失、深层自监督和图像—视频联合训练,得到同时保留空间结构、语义和时间一致性的状态表示;在真实机器人抓取实验中,相比 V-JEPA 2 AC, 成功率提高了 20 个百分点 。
这条路线可能是对“视频生成器=世界模型”最根本的修正。一个系统完全可以不擅长拍出漂亮视频,却非常擅长 预测下一状态、规划动作和控制机器人 ;对真实智能而言,后者往往更重要。
方向四:从一次性短片,走向可交互、可持续的世界
Genie 3 已经把输出从固定短片推进到可实时导航的交互环境:720p、24 帧每秒,并能维持数分钟一致性。 Kairos 则强调跨身体数据、持久状态记忆和部署效率,希望世界模型能够在 “观察—行动—反馈” 的闭环里长期运行。
2026 年 7 月发布的 Orbis 2 进一步把长时预测拆成两层:高层潜变量负责低频、长时的抽象演化,低层预测器负责高频细节。它还专门用改变车速和转向率的 反事实轨迹 测试模型,避免模型只沿着原视频惯性继续生成。
方向五:评估必须从“像不像”升级到“为什么”
CausalPhys 为 3000 多道图像和视频问题标注了 显式因果图 ,覆盖感知、预判、干预和目标导向四类任务。它不只检查答案对不对,还检查推理链是否沿着正确的对象—属性—事件依赖关系前进。
这正好补上 CGDJ 的下一块拼图:未来的测试不能只问“模型生成了什么”,还要问 “换一个条件,它会不会生成另一个正确世界” ,以及“它能不能指出变化发生在哪条因果边上”。
下一代世界模型的竞争,不只是更清晰,而是更可控、更可证、更能行动。
///
LAST
真正的世界模型,还差最后几步
THE END
读完这篇论文,一个更稳妥的结论是:视频模型已经学会了大量世界表象,也开始显露局部的因果能力,但 “世界模拟器”仍然是一个需要被证明的称号 。
真正可靠的世界模型,至少要同时做到四件事: 看懂当前状态,预测干预后的变化 ,在长时间里保持对象和规律一致,并把预测用于行动与纠错。只会生成一段视觉上合理的视频,还不够。
未来最可能胜出的也许不是一台更大的“视频打印机”,而是一套分层系统:语言模型负责提出假设,潜在世界模型维护状态,物理工具补全约束,视频生成器负责把可验证的推演渲染出来,智能体再根据反馈 重新规划 。
「当模型不仅能把杯子摔碎,还能解释为什么会碎、预测换成塑料杯会怎样,并在预测错误后主动修正,我们才更有资格说:它不是在模仿世界,而是在理解世界。」
论文信息
标题:Thinking in Video:Can Video Generators Really Reason About the Real World?
作者:Yongheng Zhang、Guang Yang、Ruihan Hou、Qiguang Chen、Ziang Liu 等
机构:中南大学、腾讯、清华大学
END
既然看到这里了,如果觉得有用,随手点个赞、在看、转发三连吧。
THANKS FOR READING









