大数跨境

【ECCV 2026】PanoSeeker:给VLA装上一张“活地图”,360°主动找物+分割一步到位

【ECCV 2026】PanoSeeker:给VLA装上一张“活地图”,360°主动找物+分割一步到位 具身智能制造
2026-07-24
2
导读:一句话洞察:现有的指代分割模型只能”被动看图”,PanoSeeker让智能体在360°全景环境中主动探索、规划路径、精准分割——成功率75.4%,探索效率比GPT-5.2高58%。
A4纸张海报.png

一句话洞察:现有的指代分割模型只能”被动看图”,PanoSeeker让智能体在360°全景环境中主动探索、规划路径、精准分割——成功率75.4%,探索效率比GPT-5.2高58%。

01

核心问题:从”被动看图”到”主动找物”

传统指代分割(RIS)假设目标就在当前视野内。但在真实具身场景中,机器人需要主动调整视角在360°环境中寻找目标(如”找到床对面的地柜”)。这要求同时具备跨视角空间推理高效主动探索能力。

对应论文图1:APRS任务示意。智能体从初始视角出发,根据语言指令(“找到床对面的地柜”)在连续的360°环境中调整观察方向(Δθ, Δϕ),搜索目标并输出分割mask。

PanoSeeker的两件套

组件

功能

核心设计

EgoSphere

空间视觉记忆

将局部观察逐步拼接为统一的360°等距全景图(ERP)

PanoSeeker

主动探索决策

VLM驱动,联合关注局部视图+全局记忆地图

对应论文图2:框架总览。PanoSeeker整合VLM与EgoSphere记忆,预测下一步移动方向(Δθ, Δϕ)。找到目标后执行主动视角对齐与分割。底部展示了搜索轨迹和记忆逐步构建过程。



















02

EgoSphere:为什么它比文本日志和视觉缓冲更强?

EgoSphere通过几何投影将局部视图统一为连续的360°表示,显著优于文本日志(+6.2% SR)和视觉缓冲。关键是它把搜索问题转化为在全景画布上的”填空游戏”——未探索区域就是零值前沿,一目了然。

SFT+RL两阶段训练:从”学会找”到”高效找”

训练阶段

SR↑

AS↓

SPL↑

Zero-shot基线

41.6%

12.4

0.14

+ EgoSphere记忆

56.5%

8.7

0.26

+ SFT专家轨迹

70.3%

6.2

0.40

+ GRPO强化学习

75.4%

4.8

0.57

GRPO RL阶段是关键一跃:通过效率奖励(鼓励沿最短测地线路径移动)和终端奖励(成功加分+IoU奖励),将平均搜索步数从12.4步压缩到4.8

核心结果:全面碾压SOTA

image.png

PanoSeeker SPLGPT-5.258%(0.57 vs 0.36),意味着以更短的路径达到更高的成功率。

对应论文图3:可视化结果。红点为初始视角,蓝框为最终找到的目标。三个场景分别展示了ALLO(“面向电视的沙发”)、UNIQ(“黄色游艇旁边的黑色游艇”)和EGO(“植物旁边的垃圾桶”)类型的成功搜索。


03

总结


四种空间推理难度

类型

占比

示例

EGO 自我中心

18.4%

“向右转找到沙发”

UNIQ 独特属性

43.3%

“房间里黄色的落地灯”

ALLO allocentric

32.2%

“沙发对面的椅子”

MULTIHOP 多跳推理

6.1%

“转身找到桌子旁边的椅子”

论文出处

本文内容整理自学术论文:《Seek to Segment: Active Perception for Panoramic Referring Segmentation》,仅作学术分享使用,版权归原作者及出版方所有。

• 论文作者:Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

• 发表单位:复旦大学

• 项目页面:https://henghuiding.com/APRS/-









关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术~

【声明】内容源于网络
0
0
具身智能制造
深耕尖端工业智能决策系统研发,涵盖高算力云化控制器与工业具身智造底座等产品,致力于实现我国高端制造与智能制造技术的自主可控!诚邀各界英才携手共进,共创行业新未来~
内容 52
粉丝 0
具身智能制造 深耕尖端工业智能决策系统研发,涵盖高算力云化控制器与工业具身智造底座等产品,致力于实现我国高端制造与智能制造技术的自主可控!诚邀各界英才携手共进,共创行业新未来~
总阅读326
粉丝0
内容52