大数跨境

腾讯混元、清华、南洋理工联手,「以小博大」破解空间智能算力与记忆断裂难题 | ECCV 2026

腾讯混元、清华、南洋理工联手,「以小博大」破解空间智能算力与记忆断裂难题 | ECCV 2026 AI科技评论
2026-09-01
15
导读:Spatial-TTT 给 2B 模型装上“流式空间记忆” ,在空间基准上超越 GPT-5。
Spatial-TTT 为 2B 模型赋予“流式空间记忆”,在空间基准测试中超越 GPT-5。

    作者丨张   璐

    编辑丨幸丽娟

单纯拉长上下文虽能增加信息容量,但在处理状态变化和时序关联等长程任务时,注意力易被稀释,关键证据难以召回。这一矛盾在具身机器人、自动驾驶等需与三维物理世界实时交互的场景中尤为突出。
真实物理世界的输入是持续涌入的视频流,要求系统具备流式空间智能——即一边接收视频流,一边实时构建并更新环境的三维空间记忆。然而,主流方案面临两重限制:
  • 算力与显存硬约束:基于 Transformer 的自注意力机制计算开销随序列长度呈二次方增长,长视频输入易导致端侧设备显存溢出。
  • 时序下采样破坏几何连续性:抽帧方案牺牲了细粒度时序信号,导致模型丢失关键的空间视差与几何线索。
根本原因在于传统模型推理阶段参数固定,无法适配物理世界的动态变化。为此,清华、腾讯混元及南洋理工团队提出最新论文《Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training》,将重心从“拉长注意力窗口”转向“推理时参数在线自适应更新”。
该研究基于测试时训练(TTT)范式,将部分参数转化为推理过程中可动态更新的“快权重”,作为紧凑的非线性空间记忆。此举既保持了线性计算开销,又使模型能在长视频中持续记忆空间细节并理解位置关系。
图 1 Spatial-TTT 整体流程示意

01 为什么不能全用 TTT?3:1 混合架构的取舍

测试时训练(TTT)通过维护一组可更新的“快权重”,利用在线梯度下降将新信息写入记忆,从而打破推理参数固定的前提,将计算复杂度从二次方降至线性。然而,若将多模态大模型的所有自注意力层替换为纯 TTT,会导致性能大幅下滑。

▎纯 TTT 损伤语义对齐,保留 25% 全注意力层

自注意力机制虽昂贵,但能确保全局特征交互,维持预训练模型的多模态对齐与逻辑推理能力。实验显示,在 VSI-Bench 消融实验中,纯 TTT 架构综合分数从 64.4% 降至 53.9%,多选题准确率下跌超 12 个百分点。
为此,Spatial-TTT 采用3:1 混合架构
  • 3:1 层级交织:Decoder 中每 4 层有 3 层改为 TTT 层,负责长视频空间时序信息的动态压缩;
  • 保留 25% 全注意力锚点:其余层保持参数冻结,负责全局语义对齐与逻辑推理,以低成本保住基座能力。

▎大块更新提效,滑动窗口补全局部连续性

为解决硬件并行效率与时空连续性的矛盾,Spatial-TTT 采用覆盖多帧的大块更新策略(Chunk Size=2648 Tokens)。为防止信息泄露并弥补大块更新导致的时空割裂,TTT 层引入双路并行结构
  • 主干路(TTT 分支):跨 Chunk 更新快权重,保存长期空间环境信息;
  • 旁路(滑动窗口注意力 SWA):负责 Chunk 内部因果注意力,补全单帧及相邻帧间的细粒度时空关系。
该设计最终整合为完整解码流程(见图 2),其中"3D Spatiotemporal Conv"模块是为快权重注入三维几何偏置的关键。
图 2 Spatial-TTT 混合架构与 TTT 层内部结构

02 让快权重真正“看懂”三维空间:3D 卷积与稳定更新

标准模型中逐点线性投影生成的 Q、K、V 默认为离散点,缺乏三维连续性,导致空间结构破碎且缺乏先验。Spatial-TTT 从特征生成和更新方式两方面进行了改造。

▎3D 卷积注入局部几何信息

团队在 TTT 分支生成 Q、K、V 后,将其重整为时空体素网格并接入轻量级3D 深度可分离卷积。通过 3×3×3 邻域聚合,为每个 Token 注入周围像素的空间关系及时序动态。卷积核采用狄拉克初始化,确保模型平滑继承基座能力后再学习几何偏置。消融实验证明,移除该机制会导致数值空间推理准确率显著下降。

▎Muon 优化器保障在线更新稳定性

针对高维多模态特征易导致权重漂移的问题,Spatial-TTT 采用带Muon 优化器。该优化器结合动量累积与 Newton-Schulz 正交化迭代,并在更新后对快权重进行模长归一化,有效防止了长视频流中的权重爆炸与特征漂移。

03 训练数据策略:从稀疏问答到密集场景描述

测试时训练的有效性取决于离线阶段是否学会“如何更新”。现有空间问答数据监督信号过弱,不足以驱动快权重建立全局三维表示。

▎密集场景描述提供强监督信号

团队构建了覆盖约 1.6 万个室内漫游样本的密集场景描述数据集。训练目标不再是短问答,而是生成包含全局场景环境、实体清单与精准计数、物体空间关系的连贯描述。这种高密度监督迫使快权重在长时序中主动编码具有长久价值的三维几何信息。

▎两阶段渐进式训练

训练分为两个阶段:
  • 第一阶段:基础构建与退火。利用密集描述数据,配合滑动窗口退火策略(窗口从大到小线性缩小),倒逼 TTT 层逐步承担长程记忆职责。
  • 第二阶段:任务精炼。接入约 300 万条空间问答数据,固定窗口大小,进一步提升模型的空间推理与指令遵循能力。
实验表明,若去掉密集场景描述预训练,模型在强依赖长程记忆的任务上表现明显退化。

04 实验结果:2B 模型在空间基准与长视频上的表现

Spatial-TTT-2B 在多个基准测试中展现出越级性能。

▎VSI-Bench 与 MindCube 表现优异

在 VSI-Bench 上,Spatial-TTT-2B 综合得分64.4%,超越 GPT-5(55.0%)和 Gemini-3-pro(56.0%),尤其在相对朝向任务上优势显著。在考验跨视角一致性与遮挡推理的 MindCube-Tiny 上,其准确率达76.2%,比 Gemini-3-pro 高出 12.3 个百分点。
表 1 VSI-Bench 各模型详细得分对比
表 2 MindCube-Tiny 跨视角空间推理结果

▎120 分钟长视频测试:抗显存压力

在极限基准 VSI-SUPER(10-120 分钟视频)测试中,传统模型在超过 30 分钟后准确率骤降甚至显存溢出。而 Spatial-TTT-2B 在 120 分钟内始终保持可用水准,未出现性能崩溃。
表 3 VSI-SUPER 长视频空间感知结果

▎显存与计算量:从二次方到线性

得益于双 KV Cache 机制(滑动窗口 KV Cache 维持恒定显存,TTT Pending 缓存即时清空),模型实现了显存与计算量的线性增长。实测数据显示,在不同输入长度下,其资源消耗远低于传统架构。
表 4 不同输入长度下的峰值显存与计算量对比

05 结束语:流式空间记忆的意义与展望

Spatial-TTT 探索出了一条兼顾算力开销与空间记忆的工程路径,验证了将部分参数转化为在线更新动态记忆体的可行性。这对于算力受限的机器人、智能座舱等端侧设备处理连续视频流具有重要意义。
未来研究仍需解决剧烈环境变化下的特征漂移防御,以及如何从高动态物体位移因果进一步跨越到连续动作序列规划等前沿课题。这项研究推动了物理空间感知从“离散单帧”向“连续流式计算”的范式转变。
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8925
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读226.2k
粉丝0
内容8.9k