作者丨张 璐
编辑丨幸丽娟
-
算力与显存硬约束:基于 Transformer 的自注意力机制计算开销随序列长度呈二次方增长,长视频输入易导致端侧设备显存溢出。 -
时序下采样破坏几何连续性:抽帧方案牺牲了细粒度时序信号,导致模型丢失关键的空间视差与几何线索。
01 为什么不能全用 TTT?3:1 混合架构的取舍
▎纯 TTT 损伤语义对齐,保留 25% 全注意力层
-
3:1 层级交织:Decoder 中每 4 层有 3 层改为 TTT 层,负责长视频空间时序信息的动态压缩; -
保留 25% 全注意力锚点:其余层保持参数冻结,负责全局语义对齐与逻辑推理,以低成本保住基座能力。
▎大块更新提效,滑动窗口补全局部连续性
-
主干路(TTT 分支):跨 Chunk 更新快权重,保存长期空间环境信息; -
旁路(滑动窗口注意力 SWA):负责 Chunk 内部因果注意力,补全单帧及相邻帧间的细粒度时空关系。
02 让快权重真正“看懂”三维空间:3D 卷积与稳定更新
▎3D 卷积注入局部几何信息
▎Muon 优化器保障在线更新稳定性
03 训练数据策略:从稀疏问答到密集场景描述
▎密集场景描述提供强监督信号
▎两阶段渐进式训练
-
第一阶段:基础构建与退火。利用密集描述数据,配合滑动窗口退火策略(窗口从大到小线性缩小),倒逼 TTT 层逐步承担长程记忆职责。 -
第二阶段:任务精炼。接入约 300 万条空间问答数据,固定窗口大小,进一步提升模型的空间推理与指令遵循能力。
04 实验结果:2B 模型在空间基准与长视频上的表现
▎VSI-Bench 与 MindCube 表现优异
▎120 分钟长视频测试:抗显存压力
▎显存与计算量:从二次方到线性

