大数跨境

动易科技刘晨澔:人形机器人羽毛球对拉 40 拍背后的分层革命 | IROS 2026

动易科技刘晨澔:人形机器人羽毛球对拉 40 拍背后的分层革命 | IROS 2026 AI科技评论
2026-09-29
3
导读:顶会上的人形机器人高动态运动场景的最新工业级进展。
顶会上的人形机器人高动态运动场景的最新工业级进展。

    作者丨邓哲敏

    编辑丨齐铖湧

                                                                                                       

羽毛球因其独特的空气动力学特性,被视为球类运动中难度极高的项目。其初速极快但衰减迅速,轨迹呈不对称弧线,且重心与压力中心分离导致飞行中自旋,极大增加了预测难度。对于人形机器人而言,应对这种高动态场景需要“大小脑”协同:小脑负责稳定的全身控制与动作执行,大脑负责策略博弈与决策。
近期,在 IROS 2026 Workshop 上,中国动易科技(PHYBOT)团队展示了最新成果:一台 1.35 米高的人形机器人在仿真中通过自我博弈学会战术,并在现实中与人类实现超过 40 拍的对拉。该团队通过将策略博弈与本能执行分离,实现了从单一技能到复杂对抗的跨越。
以下是动易科技刘晨在 IROS 2026 “Perception and Decision Making for Athletic Humanoid Robotics” Workshop 上的演讲精编。

▎Humanoid Badminton: Bringing Athletic Robots from the Lab to the Court

主讲人:刘晨澔,动易科技(PHYBOT)

01


为什么偏偏是羽毛球

过去几年,人形机器人在跑步、跳跃等基础运动技能上已趋于稳定,研究焦点正转向更具挑战性的动态体育运动。相比足球、篮球等单次接触任务,球拍类运动(如网球、乒乓球、羽毛球)要求机器人反复、可靠地击球,且目标体积小、精度高,关节微小误差会在球拍处被放大,形成极窄的击球窗口。
选择羽毛球作为突破口,主要基于其极高的技术门槛:极强的空气阻力导致速度非线性衰减,轨迹预测困难;频繁的加速减速考验下肢敏捷性与挥拍时机。此外,中国庞大的羽毛球用户群体也为其商业化落地提供了广阔场景。我们的目标是将人形机器人从实验室带向真实的运动场。

02


小脑先练步法与挥拍

实际部署面临噪声、延迟及分布外输入等挑战,要求系统具备极高的可靠性。我们的技术路线遵循“控制-技能-策略-自主性-真实部署”的路径。
1. 解决移动与击球的冲突
羽毛球运动中,步法移动与击球动作在优化目标上常存在冲突。我们采用退火式课程学习方案:第一阶段仅训练下肢移动,随后逐渐移除移动奖励,强化击球奖励。这使得早期习得的下肢能力得以保留,最终形成协调的全身动作。
2. 多样化技能与精准控制
为提升回球可靠性,我们引入多判别器方法,分别学习上旋、下旋、正反手等风格化动作,并训练学习型技能选择器(Q值函数)。该选择器根据来球轨迹评估各技能的任务效用(击中奖励与落点奖励乘积),自动选择最优技能。结合目标区域独热编码,实现了落点的精准控制。
实验显示,配备技能选择器的系统能显著延长对峙回合。目前,我们的机器人在腿式机器人羽毛球比赛中实现了最长的对峙纪录,单回合可连续对拉 40 拍以上,并能覆盖 4.4×4.4 米的场地。

03


大脑上场学会算球

为实现战略决策与竞技能力,我们将高层问题建模为零和多智能体强化学习。高层策略利用 GRu 网络观察状态,输出击球技巧与落点两个离散决策,交由低层全身控制器执行。
为避免单纯自博弈导致的循环支配困境,我们采用联盟训练机制:
  • 主智能体(Main Agent):提升整体表现;
  • 主力陪练(Main Exploiter):主动寻找主智能体弱点;
  • 联盟陪练(League Exploiter):引入多样化策略。
三者协同制造强对手,暴露并修复策略弱点。模拟结果显示,主智能体面对历史强敌时胜率稳步提升,且能有效弥补自身短板。
该框架具备良好的泛化能力,仅需约一周时间即可迁移至乒乓球和足球领域,证明了全身协调、动态交互等核心能力的通用性。

04


从实验室到球场

为实现完整闭环,机器人需具备自主捡球能力。我们开发了 DQ-Flow 算法,将运动生成与执行分离。策略利用短时 RGB 观测和本体感知,通过 flow matching 生成全身运动参考;训练时引入深度监督以增强几何表征,但部署时仅需 RGB 图像。生成的参考由混合全身控制器异步实时执行,确保机器人持续移动无需等待推理。
此外,我们还探索了基于策略蒸馏的方案:在模拟中利用特权信息训练教师策略,再通过 DAgger 让学生策略仅凭夹爪摄像头 RGB 数据克隆行为,直接输出关节目标完成捡球动作。
目前,该系统已在商场快闪场馆中部署,机器人与真人互动并自主完成捡球、运输等任务。真实环境部署验证了系统在通信、感知噪声及长期运行方面的可靠性。

05



总结本次分享的核心观点:
  1. 人类先验至关重要:有效利用人类运动数据比单纯扩大数据规模更关键。
  2. 竞争驱动提升:人类先验提供基础,但与强对手的实战博弈才能带来策略层面的进化。
  3. 超越纯仿真:需结合系统辨识、世界模型甚至真机强化学习,以应对现实世界的复杂性。
  4. 工程与算法并重:硬件迭代、低延迟控制及微调对最终性能影响巨大。
  5. 系统级思维:运动智能不仅是算法问题,更是策略、自主性、可靠性与真实世界运行能力的系统集成。

06


现场问答

▎Q:在刚才的视频里,和羽毛球机器人对打时,它用的是外部感知吗?一共用了多少个摄像头?球速有多快?

是的,使用的是动捕系统,共 8 个摄像头。快球(如杀球)速度可达每秒 20 米以上。

▎Q:你提到技能选择器会观测球的状态,还提到了对手状态,这个对手状态具体是什么?

技能选择器仅根据来球落点区域选择最适技能,不涉及对手概念。对手状态(位置、线速度、角速度)用于高层多智能体强化学习,通过动捕系统估计。

▎Q:真实世界里有空气阻力这样的空气动力学效应,你们在仿真器里也模拟了吗?

是的,仿真中已模拟空气动力学效应。

▎Q:从仿真到真实世界,你们做的是零样本迁移,还是用了其他方法?

采用零样本迁移,主要通过域随机化和添加噪声实现。

▎Q:如果想让机器人更快、更有竞争力,尤其是面对羽毛球里的杀球,你会怎么做?

主要瓶颈在于硬件,特别是关节力矩和峰值速度。视觉感知并非瓶颈,动捕系统频率可达 200Hz 以上。未来将通过硬件迭代提升性能。

▎Q:实际实时运行时,你们用的是动捕,还是端侧相机?

目前使用动捕系统。
【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8974
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读258.3k
粉丝0
内容9.0k