一句话洞察:现有的指代分割模型只能”被动看图”,PanoSeeker让智能体在360°全景环境中主动探索、规划路径、精准分割——成功率75.4%,探索效率比GPT-5.2高58%。
核心问题:从”被动看图”到”主动找物”
传统指代分割(RIS)假设目标就在当前视野内。但在真实具身场景中,机器人需要主动调整视角在360°环境中寻找目标(如”找到床对面的地柜”)。这要求同时具备跨视角空间推理和高效主动探索能力。

对应论文图1:APRS任务示意。智能体从初始视角出发,根据语言指令(“找到床对面的地柜”)在连续的360°环境中调整观察方向(Δθ, Δϕ),搜索目标并输出分割mask。
PanoSeeker的两件套
组件 |
功能 |
核心设计 |
EgoSphere |
空间视觉记忆 |
将局部观察逐步拼接为统一的360°等距全景图(ERP) |
PanoSeeker |
主动探索决策 |
VLM驱动,联合关注局部视图+全局记忆地图 |

对应论文图2:框架总览。PanoSeeker整合VLM与EgoSphere记忆,预测下一步移动方向(Δθ, Δϕ)。找到目标后执行主动视角对齐与分割。底部展示了搜索轨迹和记忆逐步构建过程。
EgoSphere:为什么它比文本日志和视觉缓冲更强?
EgoSphere通过几何投影将局部视图统一为连续的360°表示,显著优于文本日志(+6.2% SR)和视觉缓冲。关键是它把搜索问题转化为在全景画布上的”填空游戏”——未探索区域就是零值前沿,一目了然。
SFT+RL两阶段训练:从”学会找”到”高效找”
训练阶段 |
SR↑ |
AS↓ |
SPL↑ |
Zero-shot基线 |
41.6% |
12.4 |
0.14 |
+ EgoSphere记忆 |
56.5% |
8.7 |
0.26 |
+ SFT专家轨迹 |
70.3% |
6.2 |
0.40 |
+ GRPO强化学习 |
75.4% |
4.8 |
0.57 |
GRPO RL阶段是关键一跃:通过效率奖励(鼓励沿最短测地线路径移动)和终端奖励(成功加分+IoU奖励),将平均搜索步数从12.4步压缩到4.8步。
核心结果:全面碾压SOTA

PanoSeeker SPL比GPT-5.2高58%(0.57 vs 0.36),意味着以更短的路径达到更高的成功率。

对应论文图3:可视化结果。红点为初始视角,蓝框为最终找到的目标。三个场景分别展示了ALLO(“面向电视的沙发”)、UNIQ(“黄色游艇旁边的黑色游艇”)和EGO(“植物旁边的垃圾桶”)类型的成功搜索。
总结
四种空间推理难度
类型 |
占比 |
示例 |
EGO 自我中心 |
18.4% |
“向右转找到沙发” |
UNIQ 独特属性 |
43.3% |
“房间里黄色的落地灯” |
ALLO allocentric |
32.2% |
“沙发对面的椅子” |
MULTIHOP 多跳推理 |
6.1% |
“转身找到桌子旁边的椅子” |
论文出处
本文内容整理自学术论文:《Seek to Segment: Active Perception for Panoramic Referring Segmentation》,仅作学术分享使用,版权归原作者及出版方所有。
• 论文作者:Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang
• 发表单位:复旦大学
• 项目页面:https://henghuiding.com/APRS/-
关注【具身智能制造】,每周拆解机器人与 AI 领域顶会,带你紧跟前沿技术~


