大数跨境

突破具身智能物理死角:IJCAI 2026 具身智能泛化与控制突破

突破具身智能物理死角:IJCAI 2026 具身智能泛化与控制突破 AI科技评论
2026-08-12
14
导读:告别理想仿真,中国学术团队用物理工程方案回应落地挑战。
告别理想仿真,中国学术团队以物理工程方案回应落地挑战。

作者丨张璐

编辑丨岑峰

过去一年,具身智能发展迅猛。从 Physical Intelligence 发布π₀到开源社区热捧的 OpenVLA,VLA 大模型在实验室基准测试中表现优异,机械臂操作成功率常超 90%。

然而,当行业欢呼“机器人 GPT 时刻”到来时,学术界与产业界开始反思:这些数十亿参数的具身大模型,是真的学会了“举一反三”,还是在“死记硬背”?

主流观点认为 VLA 赋予了机器人常识与规划能力的“大脑”。但最新实验数据显示,面对物品位置随机挪动或新指令组合,纯端到端大模型受限于“空间过拟合”,执行成功率剧烈衰减。

这表明:具身智能要走出实验室,不仅需要大模型提供高层决策,更需要扎实的工程技术打造精准稳健的“小脑”。以下盘点入选 IJCAI 2026 的 6 项中国团队成果,它们从空间泛化、盲区感知到极端控制,为具身智能补齐了通往真实物理世界的关键拼图。

01 解决死记硬背,大模型如何搞定未见场景

具身智能的核心瓶颈在于真正的泛化能力。现有 VLA 大模型在面对未见过的指令组合或场景变化时,表现往往大打折扣。

泛化成功率跌破 21%:不重训模型,如何把成功率拉回 83%

论文:《VLAs Are Confined yet Capable of Generalizing to Novel Tasks》
作者:李全义(新加坡国立大学 CLeaR Lab 博士,现任 Oxa 高级应用科学家)

若指令为“把奶酪放进柜子”,而训练数据中奶酪总在桌子左侧,当现实中奶酪被移至右侧时,主流 VLA 大模型仍会机械地伸向左侧。

模型并未理解“奶酪”概念,仅是将词汇与固定物理坐标强行绑定。在李全义博士构建的 libero-ood 基准测试中,主流 VLA(如 OpenVLA、π₀-fast、UniVLA)在面对外推新任务时,成功率断崖式跌至 21% 以下。原因在于大模型决策时只关注末端坐标,忽视了物体本身。

研究通过机制可解释性方法,从大模型内部提炼出代表任务语义的“文本隐变量”。实施“文本隐变量插值(TLI)”后,在不重新训练模型的前提下,直接将π₀在外推新任务上的成功率从 9% 提升至 83%。该研究证明,大模型内部蕴含通用泛化潜能,关键在于找到正确的唤醒方式。

微调 0.63% 参数:4 小时练完视觉大模型,嵌入式芯片 63ms 响应

论文:《RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation》
作者:Chu Wenhui(德克萨斯 A&M 大学)

对比数据显示:传统全量微调 SAM 大模型需训练 6.32 亿参数,耗时 384 GPU 小时;而 RepSAM 方案仅微调 400 万参数,单卡 A100 训练 4 小时。参数量缩减 158 倍,训练速度提升 96 倍,感知效果却达到全量微调的 97.9%。

研究者利用中心核对齐(CKA)理论扫描 SAM 的 32 层 Transformer 网络,发现表征漂移规律:浅层网络领域差异剧烈,需高容量适配;深层网络高阶语义通用,仅需低容量适配。

RepSAM 架构图

凭借按需低秩适配,RepSAM 在透明玻璃杯分割任务上 mIoU 从 34.7% 暴涨至 90.1%,真实抓取成功率达 94.4%。更关键的是,其在嵌入式设备 Jetson AGX Orin 上响应时延低至 63ms (15.8 FPS),解决了工业级具身视觉在边端部署的时延难题。

02 指令抽象、视线遮挡,如何实现厘米级精准交互

真实场景中,机器人面临两大感知挑战:一是自然语言指令高度抽象,易导致导航迷路;二是机械臂接近物体时形成视觉盲区。

连续空间导航:提取自然语言地标,陌生环境成功率提升 7%

论文:《FILD-Nav: Vision-and-Language Navigation with Instruction Landmark Features in Continuous Environments》
团队:Chuangye Hu, Lulu Liu 等(中国学者团队)

在连续环境下的视觉 - 语言导航任务中,现有算法缺乏高阶语义引导,导致机器人难以精准匹配指令中的物理实体。中国学者提出的 FILD-Nav 框架,能自动从自然语言指令中提炼“地标特征”,并将其注入导航核心环路:

  • 地标引导的航点预测:大幅提升预测航点与真实物理地标的相关性;
  • 地标增强的拓扑规划:引入地标语义校验,增强长周期导航稳健性。

在 VLN-CE 基准测试中,FILD-Nav 的导航成功率(SR)提升 2%,路径长度加权成功率(SPL)提升 3%。在全新陌生环境中,Oracle 成功率(OSR)大幅提升 7%。这一成果为服务机器人进入复杂商场、医院与家庭场景打通了关键路线。

最后一厘米视觉盲区:无需相机参与,150 个真实物体抓取率 97.3%

论文:《PECHC: Robust Tactile Grasping Stabilization in Vision-Denied Peripersonal Space》
团队:中国科学技术大学 董二宝教授团队

视觉在接近目标“最后一厘米”时存在天然盲区。当机械臂深入狭窄空间,相机视线常被遮挡,导致传统算法失效。董二宝教授团队提出的 PECHC 算法,在视觉失灵的近身盲区将控制主导权交给触觉。

团队采用解耦控制策略,建立无需视觉参与的“安全防御反射”:

  • 混合纠偏模仿学习 (HCIL):仅需稀疏的人类专家纠偏即可高效弥合模型差距;
  • 级联约束调度 (CCS):施加物理合理的行为约束,弥合几何拓扑差距;
  • 时序异构蒸馏 (THED):从历史触觉序列中进行隐式系统识别,弥合动力学差距。

在涵盖 150 个真实物体的完全自主测试中,PECHC 实现了 97.3% 的抓取成功率,性能相比传统基线提升 42.8%,并在抓取易碎品时展现出细腻的调力能力。

03 极端控制:面对强风暗流,如何防止强化学习算法崩盘

当具身智能走向户外、高空或海洋,算法面临高度随机与非线性的真实物理扰动。中国学者在控制算法的底层数学设计上提出了创新方案。

极端海况抗扰:分布鲁棒替换反向传播梯度,碰撞率下降 12.28%

论文:《Perturbation-mitigated USV Navigation with Distributionally Robust Reinforcement Learning》
团队香港科技大学(广州)熊辉教授团队

针对无人水面艇在复杂海况下面临的传感器噪声干扰,熊辉教授团队提出 DRIQN 算法,通过两项关键突破为强化学习穿上“防护罩”:

  • 回放池显式子组建模:将转移数据按噪声模式划分,对异构噪声与最坏工况进行显式建模;
  • 轻量化“梯度替代”机制:利用分布鲁棒优化求解出的对偶二次规划,直接替换神经网络最后一层的反向传播梯度。

在模拟极端海况下,DRIQN 将导航成功率提升 13.51%,碰撞率降低 12.28%,同时实现省时 35.46% 与节能 27.99%。即便面对复合故障,其全场最高成功率仍达 58%。

突发强侧风控制:空气动力学与强化学习混合,毫秒级估计风场

论文:《Disturbance-Aware Hybrid Learning for Robust and Adaptive UAV Flight in Extreme Winds》
团队重庆大学 古富强团队

针对无人机在强阵风下易失控的问题,古富强团队提出扰动感知混合学习架构。算法构建实时风场扰动感知模块,毫秒级估计非线性气流扰动特征,并将传统空气动力学物理模型与数据驱动的强化学习策略动态混合。

该方案根据实时扰动强度毫秒级调整控制权重,实现了极端风况下的平稳悬停与高精度轨迹跟踪,是无人机从“摄影工具”跃迁为“全天候工业级生产力工具”的关键技术桥梁。

04 结语:在 Scaling Law 的信仰之外,寻找物理世界的硬解

梳理这 6 篇研究,可见一条清晰的路线分野。当硅谷团队押注 VLA 大模型的 Scaling Law,试图通过堆叠参数和数据涌现通用能力时,真实物理世界的摩擦力、盲区和噪声让端到端黑盒模型显得脆弱。

相比之下,中国学者的成果展现了“物理工程主义”路线:不再盲目追逐参数规模,而是拆解大模型内脏,用 CKA 理论摸清表征漂移,以极少参数量实现边缘部署;在视觉失灵时交由触觉反射控制;面对海浪强风,从数学底层用分布鲁棒优化为梯度更新加装防护罩。

真正的产业落地,不属于无限堆叠数据的实验室,而属于那些能精算算力成本、硬刚真实物理环境复杂扰动的方案。

99 篇论文撑起的判断:IJCAI 凭什么是推理、规划、知识的「第一主场」

蚂蚁集团 IJCAI 2026 论文盘点:让 AI 学会「随机应变」

未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8883
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读208.8k
粉丝0
内容8.9k