大数跨境

Nature子刊收录!具身智能驱动人形机器人,顶会高产密码

Nature子刊收录!具身智能驱动人形机器人,顶会高产密码 AI因斯坦
2026-08-19
2
导读:具身智能与人形机器人的融合正成为通用人工智能落地的核心方向,在灵巧操作、自主导航、人机协同等场景不断产出创新性

具身智能与人形机器人的融合正成为通用人工智能落地的核心方向,在灵巧操作、自主导航、人机协同等场景不断产出创新性成果。


我从中筛选出88篇具身智能高质量代表性论文,有的收录于Nature子刊、ICRA、IROS、NeurIPS等权威期刊会议。对论文党来说,这些工作方法逻辑清晰、实验可复现性强,既能用来快速搭建基线模型,也可为方法改进与实验设计提供参考方向,需要的可直接领取全套资料。


长按识别下方二维码,回复具身智能

无偿领全部论文合集及项目代码


MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction

MeshMimic:通过3D场景重建实现几何感知的人形机器人运动学习


文章内容

针对人形机器人运动模仿高度依赖昂贵动捕数据、运动与场景几何解耦易引发接触滑移与网格穿透等物理不一致问题,该文提出MeshMimic一体化框架。框架从普通单目视频中同步重建人体运动轨迹与场景三维几何,通过运动学一致性优化修正视觉重建噪声,再借助接触不变的MeshRetarget机制,将人与地形的交互特征迁移到人形机器人。实验证明,该方法在多种不规则地形的动态任务上表现优于场景无关基线,可低成本支撑非结构化环境下的机器人运动技能自主进化。



MerNav: A Highly Generalizable Memory–Execute–Review Framework for Zero-Shot Object Goal Navigation

MerNav:面向零样本目标导航的高泛化性记忆-执行-复盘框架


文章内容

针对视觉语言导航领域监督微调方法泛化性弱、免训练方案成功率不足的痛点,该文受人类认知与协作机制启发,提出记忆-执行-复盘三层架构的MerNav导航框架。框架构建了短时、长时、常识组成的分层记忆系统,通过执行模块完成观测分析-路径规划-动作选择的常规决策流程,借助复盘模块检测运行异常并触发纠错机制。在4个目标导航数据集上,该方法零样本表现全面超越同类免训练方法与多数监督微调方案,且已在宇树G1人形机器人上完成真实场景部署验证。



Vision-Language Models on the Edge for Real-Time Robotic Perception

面向实时机器人感知的边缘侧视觉语言模型部署研究


文章内容

针对云端部署视觉语言模型存在端到端延迟高、带宽消耗大、隐私风险突出的问题,该文以宇树G1人形机器人为测试载体,搭建了基于ORAN/MEC架构的边缘感知系统,通过WebRTC协议实现机器人与边缘节点间的低延迟多模态数据传输。研究对比了边缘与云端部署LLaMA-3.2-11B-Vision-Instruct的推理精度与延迟,同时测试了轻量化Qwen2-VL-2B模型的表现。结果显示边缘部署可保留接近云端的推理精度并降低延迟,轻量化模型可实现亚秒级响应,为机器人实时感知的落地部署提供了量化参考与架构方案。



↓↓听说在下方一键三连的都Accept了🌝

点点赞
点分享
点喜欢

【声明】内容源于网络
0
0
AI因斯坦
人工智能领域论文干货
内容 96
粉丝 0
AI因斯坦 人工智能领域论文干货
总阅读402
粉丝0
内容96