过去,受限于极短的上下文窗口,机器人往往难以记住刚刚发生的操作。针对这一痛点,英伟达高级研究科学家 Jim Fan 与斯坦福大学教授李飞飞团队合作,推出了机器人模型与训练方案 RoboTTT(Test-Time-Training Robot Policies)。
该方案将视觉运动上下文扩展至 8K 时间步,相当于赋予机器人 5 分钟的“肌肉记忆”。其性能比现有 SOTA 策略高出 3 个数量级,且未增加推理延迟。
论文链接:https://arxiv.org/abs/2607.15275
RoboTTT 的核心突破在于能将整段视频作为上下文输入,实现基于人类视频的一次性模仿。同时,它具备实时“自我改进”能力,可将修正信息纳入上下文并在执行中动态调整动作,从而在多阶段长程任务中表现卓越。
研究团队指出,上下文长度将成为机器人基础模型新的 Scaling 方向。数据显示,使用 8K 时间步上下文训练的 RoboTTT,相比 1K 时间步预训练的同一模型,性能提升达 62%。Jim Fan 更是在社交平台表示:“很快,即使是 100 万上下文,也不再是幻想。”
面向机器人策略的长上下文建模
RoboTTT 将测试时训练(TTT)嵌入机器人基础模型,利用快速权重作为模型的循环状态。每当接收传感器输入,模型即执行一步梯度更新,将历史信息写入权重。这种机制使得机器人在隐藏状态大小固定的情况下,能以较低开销保留更长历史信息,并支持部署后的持续学习。
图|RoboTTT 的模型架构、训练和推理。
RoboTTT 主要包含三项核心设计:
1. 模型架构
RoboTTT 由视觉 - 语言模型(VLM)骨干和带有 TTT 层的 DiT 动作头组成。注意力层负责处理单个时间步内的信息,而加在注意力层之后的 TTT 层则负责沿时间维度处理跨时间信息。为提升效率,模型不直接将所有视觉 - 语言 token 输入 TTT,而是利用少量 register token 在时间上传递信息。此外,为保留预训练能力,TTT 输出经 Tanh Gating 处理后融入注意力输出。
图|带有 Tanh Gating 的计算流程。
2. 序列训练
为扩展训练上下文长度,RoboTTT 结合了序列动作强制和截断反向传播算法(TBPTT)。训练时,序列动作强制为每个动作块独立采样噪声水平以稳定 flow-matching 训练;TBPTT 则将长序列切分为片段,仅在片段内反传梯度,但允许快速权重跨片段传递。此举既确保 TTT 贯穿整条序列,又将显存开销控制在片段长度范围内。
图|TBPTT。
3. 长上下文约束
RoboTTT 引入机制,使部分时间步仅作为上下文使用:这些时间步会写入快速权重,但不参与动作损失计算。基于此,模型可从两类上下文中学习:
- 视频模仿:人类视频作为上下文,仅更新快速权重;动作损失在同任务机器人轨迹上计算。测试时,单个人类视频即可作为未见配置的条件。
- DAgger 蒸馏:完整 DAgger 轨迹均更新快速权重,其中次优机器人动作提供失败上下文,人类纠正动作提供监督目标;损失仅在人类纠正动作上计算,将失败后的纠正策略写入快速权重。
图|DAgger 蒸馏。
上下文越长,性能越强
研究团队在三个长程双臂装配任务上评估了 RoboTTT。结果表明,该模型不仅能利用更多历史信息提升闭环性能,还仅需一段包含上下文的人类视频,即可实现一次性模仿、实时自我改进及对物理扰动的鲁棒应对。
图|评估任务。
1. 长程任务表现持续优于基线
主评估显示,RoboTTT 的平均任务完成分数达 79%,显著高于单步上下文基线 GR00T N1.7 及将 TTT 层替换为 Gated DeltaNet 的 GDN 模型。
图|主评估:三个装配任务上的任务完成分数。
此外,RoboTTT 是完全成功次数最多的方法。特别是在平均耗时约 5 分钟、包含 10 个阶段的“齿轮机器人”(Gear Bot)任务中,RoboTTT 是唯一能完整完成任务的方案。
图|主评估:三个装配任务上的完全成功试验次数。
实验证明,简单拼接过去观测并不能可靠提升表现。在玩具车装配任务中,加入历史帧的基线得分反而低于仅看当前观测的模型。GDN 虽将历史压缩为循环状态,但未在所有任务上带来提升。
RoboTTT 更善于跟踪任务进度、恢复错误及完成细粒度操作。在视觉相似的多阶段装配中,它能更好区分当前阶段;面对电钻未对准螺丝等情况,它能重新对齐并再次尝试;在插入、扣紧电路组件等精细操作中,动作也更为精准。
2. 预训练上下文越长,闭环表现越佳
研究显示,当预训练上下文从 128 扩展至 8K 时间步后,RoboTTT-8K 的平均任务完成分数达 71.5%,比 1K 版本高 63%,比短上下文基线高 57%,且未见性能饱和迹象。相比之下,上下文变长并未给 GDN 带来同等提升。
团队认为,差异源于更新机制:RoboTTT 通过梯度下降更新快速权重,并学习其初始化与更新方式;而 GDN 使用线性关联状态,缺乏这种元学习机制。
图|闭环性能随预训练上下文长度扩展而提升。
3. 一次性模仿与扰动鲁棒性
RoboTTT 能基于上下文中的视频实现 one-shot 模仿。在电路装配任务中,机器人仅凭上下文中的人类视频即可判断装配配置。结果显示,RoboTTT 在 10 次未见配置试验中成功 6 次,任务完成分数为 65%;而 GDN 未取得完全成功,分数仅为 33%。
图|从上下文内人类视频进行一次性模仿。
长上下文约束同样提升了扰动恢复能力。当人为移除已安装部件时,RoboTTT 能根据部署情况返回并重新安装。数据显示,车顶被移除时,RoboTTT 恢复率为 75%,高于 GDN 的 65% 和短上下文基线的 50%;轮胎被移除时,RoboTTT 与 GDN 恢复率均达 90%,亦优于短上下文基线。
4. 更强的即时恢复能力
RoboTTT 展现出优于标准 DAgger 的即时恢复能力。标准 DAgger 仅在人类纠正动作上微调,平均提升 9%;而 DAgger 蒸馏将完整轨迹(含次优动作)作为上下文,仅在纠正动作上计算损失,平均提升达 33%。通过该技术,RoboTTT 学会了隐式纠错算法,能在线从自身错误中恢复,无需人工干预。
图|DAgger 蒸馏在 Pup Go Car 上的结果。
不足与未来方向
尽管 RoboTTT 展示了上下文长度作为机器人基础模型新 Scaling 轴的潜力,但研究团队也指出了现存不足:
首先,扩展训练上下文长度会增加训练成本。虽然推理成本恒定,但训练更长上下文仍需更多开销。未来需采用更高效的 TTT 训练技术(如 TNT)以降低成本。
其次,TTT 层的目标函数仍有探索空间。当前工作提出了整合方法,但面向机器人的 TTT 层特定目标函数(类似视觉领域的探索)将是极具潜力的研究方向。
此外,RoboTTT 尚未覆盖部署中可能出现的全部失败模式。团队表示,将 RoboTTT 与强化学习结合以直接优化任务成功率,有望进一步提升实际执行表现。
更多技术细节,详见原论文。
作者:夏千斯
【免责声明】转载出于非商业性的教育和科研目的,只为学术新闻信息的传播,版权归原作者所有,如有侵权请立即与我们联系,我们将及时删除。

