当机器人从静态演示走向产线动态部署,工程矛盾日益凸显:物理世界的连续性与端侧推理的高延迟形成冲突。尽管“动作分块”机制被广泛采用,但在有限算力下,模型难以跟上机械臂的高频节拍,停顿即意味着任务失败。
工业界常用的“异步推理”虽保障了运动连续性,却破坏了在线强化学习的因果基础,导致算法无法区分“计划动作”与“实际执行”,造成策略更新混乱。针对这一制约具身模型在线微调的核心难题,星尘智能(Astribot)基座模型团队推出了面向异步执行环境的在线强化学习框架——SmoothRL。
该框架的核心在于建立策略更新与硬件实际执行的严格对应关系:剔除未下发的预测指令,仅依据电机真实轨迹进行算账更新。实验数据显示,在连续投掷任务中,SmoothRL 经 250 轮真机训练,将任务成功率从 39% 提升至 94%,有效攻克了高速物理交互中的延迟失准问题。
SmoothRL 整体框架:机器人在异步执行中持续产生真实数据,基础策略提供通用能力,在线 RL 会根据真实执行结果更新动作策略。
投掷任务是衡量机器人动态控制能力的经典标尺,要求机械臂在毫秒级窗口内精准释放。SmoothRL 相关论文已发布,由星尘智能王佳楠担任项目负责人,高广、农宇轩为共同第一贡献者。
异步推理的“时差陷阱”
在具身大模型部署中,异步推理已成为常态:机械臂保持高频运动,模型后台并行计算下一段动作。然而,这种机制击穿了强化学习赖以生存的时序逻辑。
传统在线强化学习基于规整的因果关系:模型输出动作,机械臂执行,算法据此复盘。但在异步流水线中,这种一一对应关系不复存在:
这导致模型“计划的”、机械臂“执行的”以及中途“被丢弃的”动作混为一谈。若强化学习对此不加区分地更新策略,将导致严重的误判:未发生的动作或因时延未调整的动作被错误奖励或惩罚,致使策略更新陷入剧烈震荡。
解法:剔除无效预测
SmoothRL 的核心逻辑务实而精准:切断未执行动作的奖惩链路,仅针对机械臂现场真正执行过的动作进行优化。
具体实现上,SmoothRL 将异步执行下的每个动作分块划分为三个物理区域:
- 已提交区域(Committed):模型推理期间,机器人必须执行上一轮旧指令的区间,属既成事实;
- 执行区域(Execution):新指令生成后至下一轮计算前,真正驱动电机并与环境交互的动作切片;
- 丢弃区域(Discarded):模型构想但被后续指令覆写替换的无效预测。

SmoothRL 将异步 action chunk 划分为 Committed / Execution / Discarded 三个区域,并只让价值梯度通过真正执行的 Execution Region
在算法回传阶段,SmoothRL 引入精准掩码机制,严格限制策略与价值梯度仅穿过 Execution 区域,直接切断 Committed 和 Discarded 区域的更新链路。
为确保训练与部署环境一致,SmoothRL 确立“在部署中强化”原则,让模型直接在真实的异步延迟与时钟节拍下运行。工程架构上采用稳健的残差强化学习:
- 冻结大模型底座:采用微调后的π0.5 作为基础策略,提供宏观意图;
- 轻量残差网络调细节:构建轻量级 Actor-Critic 网络,专门预测微调修正量;
- 硬件节拍适配:以星尘 S1 为例,硬件 30Hz 执行,模型 5Hz 推理。在 200ms 窗口生成的 32 帧动作中,仅 6 帧属于 Execution 区域,算法仅利用这 6 帧真实轨迹进行更新。
实战检验:把系统性失误收敛为微小扰动
该机制在星尘智能 S1 绳驱本体上完成了三项代表性真机测试:
动态投掷(39% → 94%)
投掷任务要求机械臂在摆动中持续积累加速度并精准释放。任何数十毫秒的停顿都会导致动量丢失。在异步执行保障连续运动的前提下,SmoothRL 仅用 250 轮交互便将成功率从 39% 大幅提升至 94%。
给笔戴帽(8% → 83%)
双臂协同对齐公差仅在 5mm 左右。基础大模型可将笔带至笔帽附近,但缺乏微观调整能力。SmoothRL 通过现场试错,补齐了末端毫米级的自适应微调。
快递开箱(30% → 90%)
机械臂需持刀片刺入 2—3mm 接缝并切开胶带。面对基础策略的视觉标定偏差及物理接触阻抗,SmoothRL 在经历初期波动后逐步收敛,克服局部卡顿,最终成功率达 90%。
三项真机任务随累计 rollout episodes 增加的成功率变化
更具说服力的是机器人“犯错方式”的改变。微调前,失误多为致命的结构性偏差(如恒定距离错误、固定方向偏离);微调后,这些顽固偏差被抹平,剩余失败样本仅为微小的边缘擦碰或 1—2mm 的偏差。
动态投掷中的 Velocity / Acceleration / Jerk 对比
在线 RL 在此充当了“肌肉记忆修正器”。引入动作平滑约束后,机械臂末端加速度均方根降低 52%,加加速度(Jerk)降低 47%。在成功率倍增的同时,动作更加平顺,有效降低了机械磨损。
如果说预训练大模型解决了机器人“会不会做”的广度问题,那么 SmoothRL 这类在线后训练机制,正通过剔除时差干扰、精准对齐执行轨迹,解决机器人在真实工业现场“能不能稳定做好”的深度问题。
声明:本文为 AI 前线编译,不代表平台观点,也不构成投资建议,未经许可禁止转载。


