具身智能与人形机器人的融合正成为通用人工智能落地的核心方向,在灵巧操作、自主导航、人机协同等场景不断产出创新性成果。
我从中筛选出88篇具身智能高质量代表性论文,有的收录于Nature子刊、ICRA、IROS、NeurIPS等权威期刊会议。对论文党来说,这些工作方法逻辑清晰、实验可复现性强,既能用来快速搭建基线模型,也可为方法改进与实验设计提供参考方向,需要的可直接领取全套资料。
长按识别下方二维码,回复【具身智能】
无偿领全部论文合集及项目代码
MeshMimic: Geometry-Aware Humanoid Motion Learning through 3D Scene Reconstruction
MeshMimic:通过3D场景重建实现几何感知的人形机器人运动学习
文章内容
针对人形机器人运动模仿高度依赖昂贵动捕数据、运动与场景几何解耦易引发接触滑移与网格穿透等物理不一致问题,该文提出MeshMimic一体化框架。框架从普通单目视频中同步重建人体运动轨迹与场景三维几何,通过运动学一致性优化修正视觉重建噪声,再借助接触不变的MeshRetarget机制,将人与地形的交互特征迁移到人形机器人。实验证明,该方法在多种不规则地形的动态任务上表现优于场景无关基线,可低成本支撑非结构化环境下的机器人运动技能自主进化。
MerNav: A Highly Generalizable Memory–Execute–Review Framework for Zero-Shot Object Goal Navigation
MerNav:面向零样本目标导航的高泛化性记忆-执行-复盘框架
文章内容
针对视觉语言导航领域监督微调方法泛化性弱、免训练方案成功率不足的痛点,该文受人类认知与协作机制启发,提出记忆-执行-复盘三层架构的MerNav导航框架。框架构建了短时、长时、常识组成的分层记忆系统,通过执行模块完成观测分析-路径规划-动作选择的常规决策流程,借助复盘模块检测运行异常并触发纠错机制。在4个目标导航数据集上,该方法零样本表现全面超越同类免训练方法与多数监督微调方案,且已在宇树G1人形机器人上完成真实场景部署验证。
Vision-Language Models on the Edge for Real-Time Robotic Perception
面向实时机器人感知的边缘侧视觉语言模型部署研究
文章内容
针对云端部署视觉语言模型存在端到端延迟高、带宽消耗大、隐私风险突出的问题,该文以宇树G1人形机器人为测试载体,搭建了基于ORAN/MEC架构的边缘感知系统,通过WebRTC协议实现机器人与边缘节点间的低延迟多模态数据传输。研究对比了边缘与云端部署LLaMA-3.2-11B-Vision-Instruct的推理精度与延迟,同时测试了轻量化Qwen2-VL-2B模型的表现。结果显示边缘部署可保留接近云端的推理精度并降低延迟,轻量化模型可实现亚秒级响应,为机器人实时感知的落地部署提供了量化参考与架构方案。
↓↓听说在下方一键三连的都Accept了🌝

