大数跨境

机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026

机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026 AI科技评论
2026-08-31
1
导读:S²-VLA 引入信念状态和自适应动态门控,仅用2B参数、7GB显存,长程操控超越7B模型。
S²-VLA 引入信念状态和自适应动态门控,仅用 2B 参数、7GB 显存,长程操控超越 7B 模型。

作者丨张   璐

编辑丨幸丽娟

过去一段时间,Scaling Law 在具身智能领域备受推崇。为完成复杂的搬运与组合任务,多数研究将视觉 - 语言 - 动作(VLA)模型参数量推至 7B 甚至 8.5B。虽然大参数提升了语义理解与场景识别能力,但长程操控中的不稳定性问题并未解决。

许多大参数 VLA 模型在执行到第 10 步及之后时常出现突然失败。核心原因在于累积误差放大:早期微小的定位偏差会在后续步骤中逐步放大,最终导致抓取失败或动作中断。即便参数量增加,模型在动作后半程仍难以及时纠正偏差。

针对这一痛点,华东师范大学与上海交通大学团队提出了 S²-VLA。该工作由谢志鹏、韩宗益(共同一作)、赵静(通讯作者)和孙仕亮等完成。团队未继续堆叠参数,而是引入信念状态和自适应动态门控,使模型能根据当前阶段调整注意力分配。结果显示,仅 2B 参数的 S²-VLA 在 LIBERO-Long 基准上达到 96.4% 的成功率,超越了多数 7B 乃至 8.5B 的模型。

论文链接:https://arxiv.org/pdf/2606.27872

以下从机制原理与实际表现两方面解析其技术路径。

01 静态注意力:微小偏差为何会一路放大

传统 VLA 在长程任务中常面临失败风险。在解耦式 VLA 架构中,上层策略头将视觉和语言特征映射为控制指令。多数方法采用静态特征融合(Static Fusion),即视觉、语言和动作历史的权重比例在整个任务过程中固定不变。

这种模式在短任务中尚可接受,但在长程序列中暴露出两大缺陷:

第一,早期若出现毫米级定位偏差,模型无法及时提高视觉权重进行纠偏,导致误差累积直至任务失败。

第二,子任务切换时缺乏对高层意图的动态调整,模型易偏离当前指令,造成动作中断或停滞。

静态融合相当于全程使用同一套“注意力配比”应对不同阶段需求:需精细对准时视觉权重不足,需切换目标时意图权重不够。S²-VLA 则通过随阶段调整策略来解决这一问题:精准对准时提高视觉权重,任务切换时提升意图权重以重新锁定目标。

02 核心机制:信念状态 + 三路自适应注意力

为实现阶段自适应的注意力分配,S²-VLA 架构主要包含两个核心部分:

信念状态(Belief State)

模型利用轻量级循环网络,实时接收上一时刻的动作历史和关节传感器反馈。它不直接输出动作,而是在内部维持一个“信念状态”,用于判断当前执行进度及是否存在偏差。

该状态无需人工标注阶段标签,完全依靠端到端预测下一个动作的损失来驱动,在潜空间中自主学习任务进度和执行质量的估计。训练时仅优化最终动作预测,信念状态作为中间表征被间接监督,从而自发形成对“进度”和“偏差”的感知。

三路自适应注意力(SSGAA Module)

基于信念状态提供的阶段信号,SSGAA 模块将策略头的特征融合拆分为三条平行通道:

  • 局部视觉通道(Visual Cross-Attn):接入 VLM 低层视觉 Token,负责精细空间定位和对准;
  • 全局意图通道(Intent Cross-Attn):接入高层语义 Token,负责子任务规划和目标理解;
  • 动作自注意力通道(Action Self-Attn):在预测的未来多步动作间建立时序关系,保持轨迹连贯。

信念状态生成动态门控权重,根据当前阶段决定三条通道的比重:高精度定位时视觉通道权重上升;切换子任务时意图通道权重上升;平稳移动阶段则由动作自注意力通道主导。消融实验表明,将门控加在策略头中间层(如第 12 层)效果最佳,既保持了特征稳定,又保留了自适应能力。

03 31 步里的注意力变化:和关键动作帧对齐

实际执行中,三路门控权重随任务阶段显著变化。通过将 31 个推理步骤的门控曲线与关键动作帧对齐,可清晰观察其规律。

以“把芝士盒和黄油放进篮子”为例,分析如下:

瞄准与定位阶段(关键帧 4、9、21、26):绿色曲线(视觉门控权重)明显升高。当末端执行器接近目标时,模型提高视觉权重以进行更精细的空间定位,及时纠正毫米级偏差。

抓取与子任务切换阶段(关键帧 7、16、23、30):红色曲线(意图门控权重)升高。在夹爪闭合、物体放入篮中或切换目标时,模型提升高层意图权重,确保子任务切换流畅不中断。

稳态平移阶段(关键帧之间的过渡期):蓝色曲线(动作自注意力)保持较高水平,主导轨迹生成。此阶段主要依赖时序关系保持运动平滑,减少对无关视觉细节的计算,优化算力分配。

结果表明,2B 参数的 S²-VLA 之所以能超越更大模型,关键在于其注意力机制不再一成不变,而是按阶段将算力分配到最需要的地方。

04 动态注意力、分层解耦与端侧效率

S²-VLA 的设计理念与当前空间智能、世界模型方向的讨论高度契合,主要体现在三点:

随任务阶段动态调整注意力

物理世界模型不能仅静态看图,需在时空变化中动态分配注意力。传统 VLA 的静态融合缺乏此能力。S²-VLA 通过信念状态与动态门控,实现了接近物体时提高局部视觉权重、任务切换时提高意图权重的自适应机制。

高层语义与低层控制解耦

业界趋势倾向于将“看”(高层语义)与“动”(低层控制)解耦。直接用大单体模型拟合所有关节角度成本高且鲁棒性差。S²-VLA 采用分层思路:底层 VLM 负责语义和几何表征,策略推理利用轻量信念状态调节注意力门控。这使得小模型在长程任务上也能表现稳定。

端侧可用的显存和吞吐

实际部署看重成本与响应速度。S²-VLA 推理显存仅需约7GB,吞吐量达80.8 Hz(同类 7B 模型通常仅几 Hz)。这意味着无需依赖大型服务器远程控制,显著降低了响应延迟和部署门槛,对家电或工厂场景的落地具有重要参考价值。

05 结语:参数量之外,更需要阶段自适应的调度

S²-VLA 的价值不仅在于提升成功率,更证明了长程操控中单纯增加参数量并非唯一出路,阶段自适应的注意力机制同样关键。

大参数量虽能增强语义理解,但长程动作的稳定性取决于能否在对的阶段将算力分配到位。静态融合将所有阶段等同处理,易放大误差;动态门控则让模型在需要纠偏时关注视觉,切换时关注意图,平稳时维持连贯。

对于具身智能和 Agent 系统而言,在端侧显卡上以低显存、高频率运行的方案更具落地前景。相比单纯扩大模型规模,具备阶段自适应调度能力的架构或许更具长期价值。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8922
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读224.8k
粉丝0
内容8.9k