大数跨境

群核科技联手英伟达、英特尔、浙大,三篇 ECCV 论文给物理 AI 造基础设施

群核科技联手英伟达、英特尔、浙大,三篇 ECCV 论文给物理 AI 造基础设施 AI科技评论
2026-09-03
1
导读:去哪训练、拿什么学、怎么考?这是物理AI从实验室走向现实世界的三个核心问题,现在有了系统性答案。
去哪训练、拿什么学、怎么考?这是物理 AI 从实验室走向现实世界的三个核心问题,如今有了系统性答案。

作者丨张 璐

编辑丨幸丽娟

物理人工智能(Physical AI)与具身智能正经历深刻的范式转移。从早期局限于单一任务的特定控制算法,到如今依托多模态大模型实现对三维物理世界的感知、推理与决策,AI Agent 正逐步突破数字边界。

然而,当智能试图走出虚拟空间迈入现实世界时,底层基础设施的匮乏成为最大掣肘。要支撑物理 AI 的持续进化,行业必须回答三个核心问题:去哪里高效训练?高质量数据从何而来?如何科学评估空间智能?

群核科技集结了英伟达、英特尔、Adobe 等产业巨头,携手浙江大学、帝国理工学院、苏黎世联邦理工学院等全球顶尖学术机构,共同交出了一份系统性答卷。

这三个问题分别对应三篇入选 ECCV 2026 的论文。以下为详细解读。

01 SPEAR:打破仿真“画质 - 速度 - 可编程”不可能三角

智能体的大规模感知与动作训练离不开高保真仿真器,但传统方案往往难以兼顾“画质”与“速度”。针对这一瓶颈,群核科技携手 NVIDIA、Adobe Research 等团队推出了高保真具身仿真器 SPEAR,从底层同时实现“高保真”、“可编程”与“极速运行”。

作为一个轻量且模块化的 Python 库,SPEAR 重新设计了 Python 与游戏引擎的通信机制。它直接对接 Unreal Engine (UE) 的 C++ 运行时反射系统,无需编写海量封装代码,即可在运行时动态查找类、调用函数并修改变量。

该设计向 Python 开放了14485 个 UE 原生函数53537 个属性,可编程能力较传统仿真器提升一个数量级,而自身代码量精简至约 2.7 万行。开发者仅需在 C++ 中增加一行标记,即可在 Python 端调用全新的自定义逻辑。

针对数据传输痛点,SPEAR 引入进程间共享内存机制,实现图像从 GPU 到 Python NumPy 数组的 Zero-Copy 传输。同时,其以“事务”为核心的异步编程模型,通过独立服务器线程排队处理任务,完全不阻塞 UE 游戏主线程,确保仿真按原生帧率高效运转。

性能方面,SPEAR 相机传感器在 1080P 分辨率下可达73 FPS,端到端渲染速度比 UnrealCV+ 快 15 倍,比 AirSim 快 12 倍。除常规视觉图像外,还能直接导出深度图、法线图、语义分割及 PBR 参数等多模态数据。

SPEAR 在多个复杂场景中展现出巨大应用潜力:

  • 全地形多 Agent 精准控制:同时操控行人、汽车、飞行及四足机器人等 6 种具身智能体。
  • 动态程序化场景(PCG)调控:实时操纵大型地形要素及天空光影变化。
  • 与物理引擎协同仿真:支持 MuJoCo 实时 Co-Simulation,同步渲染高保真三维视觉。
  • 自然语言驱动的场景编辑:大模型编码助手可根据自然语言指令自动编写代码重构场景。

02 Syn-GRPO:告别死记硬背,让大模型“自己造试卷”

解决训练环境后,物理 AI 的另一核心痛点在于后训练阶段的强化学习效率。针对当前 GRPO 等算法面临的“数据质量陷阱”,群核科技与浙江大学合作提出 Syn-GRPO 框架,通过在线自进化合成数据破解难题。

研究发现,MLLM 在训练初期易出现“熵崩溃”和“多样性崩溃”,本质原因是现有视觉数据集样本格式与背景过于单一。先前尝试多从算法正则化入手,治标不治本。Syn-GRPO 转而让模型在强化学习循环中在线“自进化”地生成高质量、高响应多样性的训练样本

针对视觉感知任务对标注精准性的苛刻要求,Syn-GRPO 设计了前景一致性生成机制:利用 BEN2 分割模型抠出目标主体,保留原坐标,仅替换并重绘背景。这既保证了标注准确性,又极大扩充了背景多样性。

此外,数据服务器与 GRPO 训练流采用完全解耦的异步通信架构,训练耗时仅增加约 5%。为确保新图像击中模型“认知盲区”,GRPO 工作流重构了输出结构,要求模型预测“响应多样性得分”及用于生成新图像的“文本描述”,并通过多样性奖励引导模型识别复杂场景。

实测显示,Syn-GRPO 在 REC、OVD 及 ISR 三大任务中表现优异。以 Qwen2.5-VL-3B 为基座,其在 LISA-Grounding 上准确率达68.28%,大幅领先竞品;在 RefCOCO 数据集上更是达到92.15%

实验还观察到“自进化 Scaling 现象”:随着训练推进,生成的图像背景愈发杂乱、遮挡关系更复杂。这表明 Syn-GRPO 构建了动态演化系统,能自动为模型生成难度更高的“新试卷”,具备优秀的长程训练可扩展性。

03 WalkerBench:走出实验室,去真实世界里考 AI 的空间感

在搭建仿真环境与实现数据自进化后,如何科学衡量智能体在三维物理世界中的真实空间智能?当前主流评测多基于静态图片或预录视频的“旁观者视角”,无法反映主动交互中的空间认知能力。为此,群核科技联合浙江大学等团队推出WalkerBench,重新定义物理 AI 空间感知评测标准。

作为首个基于真实街景与地图数据的全球尺度交互式评测基准,WalkerBench 剥离 GPS 等先验信息,要求 Agent 仅凭第一视角 RGB 输入完成自主探索。其覆盖全球 6 大洲 160 多座城市,特意选用大量非英语城市以抑制地理常识偏见。任务体系分为两大层次:

  • 主动感知:通过移动消除几何歧义,估计距离、高度及方位。
  • 空间导航:在 8 种城市拓扑结构中完成长程导航,包含结构导航与多模态导航。

针对主流 VLM 在长程测试中出现的记忆崩塌与方向迷失,WalkerBench 提出Spatial-IDE破局框架,通过两大机制解耦空间感知与高层推理:

1. 状态外化与显式拓扑记忆(ETM)

将隐式视觉观测转化为动态显式拓扑记忆图,实时记录节点坐标、朝向及语义,并以固定 Token 预算序列化传输,为大模型提供精准的“空间地图外挂”。

2. 认知解耦与目标导向感知(GDP)

将任务拆解为高层空间推理引擎与目标导向感知模块。推理引擎专注全局规划,感知模块专职回答局部问题,防止过长上下文压垮推理能力。

实验数据显示,未配备辅助框架的顶尖 VLM Agent 任务完成率最高仅 24.49%,远低于人类的 69.43%。引入 Spatial-IDE 框架后,9 个主流 VLM Agents 平均得分提升104.97%。其中,GPT-5-chat-latest 性能暴涨119.98%

为进一步验证实战能力,研究团队将 Spatial-IDE 部署于宇树 G1 人形机器人。在未经特定环境微调下,机器人凭借单目 RGB 摄像头和自然语言指令,在真实开放街道完成了千米级自主导航,证明了系统从数字仿真向真实世界迁移(Sim-to-Real)的可行性。

04 从虚拟仿真到真机部署:物理 AI 需要什么样的技术底座?

这三项入选 ECCV 2026 的工作分别切中了具身智能的关键瓶颈:SPEAR 平衡仿真画质与效率,Syn-GRPO 解决数据崩溃问题,WalkerBench 提供可交互的物理评测标准。更重要的是,它们构成了一套相互咬合的具身数据循环机制:

  • SPEAR(仿真环境):提供高效率、低成本的虚拟演练平台,解决数据源头供给。
  • Syn-GRPO(算法进化):引入前景一致性生成,让数据随训练动态变难,摆脱对静态数据集依赖。
  • WalkerBench(空间评测):检验空间推理与导航能力,其暴露的能力边界反向指导仿真构建与样本生成。

从“虚拟仿真”到“在线自进化”再到“真机实测”,数据、算法与评测形成了动态演进闭环。这表明物理 AI 的竞争正从单一模型参数比拼转向基础设施层建设。群核科技结合自身在 3D 数字孪生与图形学渲染领域的积累,通过与全球团队合作推出的三项成果,尝试为物理 AI 搭建一套涵盖“仿真 - 训练 - 评测”的技术底座,为具身智能落地提供切实参考。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

//

推荐阅读

腾讯混元、清华、南洋理工联手,「以小博大」破解空间智能算力与记忆断裂难题 | ECCV 2026

光照改了,人却变了?美图 ECCV 论文提出一致特征传输重打光新方案 CFT | GAIR Paper 126

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8931
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读229.7k
粉丝0
内容8.9k