大数跨境

从大疆到华为再到求之,韩磊:世界模型定义之争都是话术,核心只看泛化能力

从大疆到华为再到求之,韩磊:世界模型定义之争都是话术,核心只看泛化能力 AI科技评论
2026-08-14
5
导读:家庭机器人最大竞争力:不是故事,是泛化能力。
家庭机器人核心壁垒:泛化能力。

作者丨齐铖湧

编辑丨林觉民 董子博

世界模型是今年具身智能行业最热门的技术概念之一。从高校实验室到科技巨头,再到初创企业,各方势力纷纷入局。然而,关于“世界模型究竟是什么、能做什么、离落地还有多远”,业界尚无定论。在无锡,我们与求之科技世界模型负责人韩磊进行了一场深度对话。

韩磊拥有横跨学术与工业界的背景:曾参与大疆 Phantom 4 研发,赴港科大攻读博士,后在华为海思前沿实验室从事世界模型预研,现负责求之科技世界模型的全链路工作。求之科技由清华大学智能产业研究院副教授周谷越发起,近期已完成天使 + 轮融资

对话中,韩磊坦率剖析了世界模型的技术分层、数据策略、算力瓶颈及行业乱象,并阐述了求之科技“不讲大故事,做最小闭环”的务实路线。

01 现状:定义之争与架构逻辑

世界模型的核心价值

AI 科技评论:今年具身智能公司都在讲“世界模型”,但定义差异极大。您关注这些定义之争吗?

韩磊:这更多是话术层面的区分。从业者不应陷入定义泥潭,核心问题只有一个:模型是否具备泛化能力。

AI 科技评论:如何理解这种泛化能力?

韩磊:工业场景标准化,传统控制算法或 VLA 即可胜任;但家庭场景是非标的(如桌椅摆放、光线变化)。以叠衣服为例,叠见过的衣服是工程问题,叠从未见过的新款式则是世界模型需跨越的鸿沟。实现真正泛化,需要底层架构突破及真实物理世界数据的支撑。

S0-S3 分层技术架构

AI 科技评论:求之内部的技术架构是怎样的?

韩磊:我们采用 S0 至 S3 的四层架构,旨在最快通向物理 AGI:

  • S0(末梢):电机、定位等底层硬件模块;
  • S1(小脑):负责具体动作输出,如抓取;
  • S2(快脑):即世界模型层,负责预测未来状态变化;
  • S3(慢脑):相当于大脑,负责任务拆解与调度(Agent)。

我负责的 S2 层世界模型,优势在于:兼顾多模态具身表征(触觉/视觉/本体状态),引入隐空间像素轨迹预测以提升可解释性与计算效率;原生适配 3D 视觉,通过双目观测显式输入 3D 信息;并与仿真器形成“模型越准→仿真越真→数据越丰富”的正向循环,持续减少 Corner Case。

AI 科技评论:分层架构会被误解为只能做短任务吗?

韩磊:事实相反。复杂任务是原子操作的组合。分层架构能聚合相似简单任务,最大化数据利用效率。即使在数据稀缺阶段,也能通过原子操作复用启动数据飞轮,加速物理 AGI 演进。

AI 科技评论:李飞飞提出“渲染器、模拟器、规划器”三合一,您认为会统一吗?

韩磊:长期看肯定会融合,但在现阶段,每个模块单独落地并产生商业价值更为务实。前提是各子模块能力足够强,正如 Agent 框架建立在强大基础模型之上。

具身公司的两种路线分野

AI 科技评论:行业存在两种风格:一种是极复杂的长流程 Demo,另一种是做短程高交互基础操作。您怎么看前者?

韩磊:长流程 Demo 如今已难令业内人士信服,常被质疑是过拟合的纯演示。我们更关注可泛化的机器人操作。无论长程还是短程,只要家庭场景有确切需求,我们都会做。但若小事不够鲁棒精细,长 Demo 意义有限。

AI 科技评论:从小任务做起会影响融资吗?资本喜欢大故事。

韩磊:关键在于方法的可扩展性。若为做小事而用规则驱动取巧,那是错的。我们要解决家庭场景下的复杂泛化问题,以实际解决问题为导向,而非以 Demo 为导向。

AI 科技评论:行业普遍采用分精度规则驱动(如米级识别、亚毫米级抓取),您怎么看?

韩磊:通用机器人的最大挑战是任务不确定性,必须靠数据驱动而非规则驱动。规则无法规模化,而世界模型通过预测未来表达动作逻辑,这条路才具备可扩展性。

02 我们的判断:仿真、数据与算力

仿真路线:DISCOVERSE vs Cosmos

AI 科技评论:贵司自研仿真器 DISCOVERSE 与英伟达 Cosmos 有何不同?

韩磊:DISCOVERSE 2.0 融合场景表征与物理引擎,核心目标有二:一是保证物理精确性,复用 MuJoCo 等成熟引擎保障刚体接触力与触觉仿真精度;二是兼顾渲染真实感与效率,作为全球首个基于 3DGS 技术的具身智能端到端仿真框架,可实现上万 FPS 并发渲染,完成端到端模型闭环验证。

AI 科技评论:各自优劣势是什么?

韩磊:Cosmos 优势在于通用性,但物理真实性存疑;UE5 路线则慢且贵。DISCOVERSE 的优势在于极高的渲染效率及真实的物理交互能力,能精确还原柔性物体动力学行为。虽在通用性上暂时不及端到端视频生成模型,但对机器人训练验证更具实用性。

数据策略:UMI 方案与临界点

AI 科技评论:无锡数采厂采用什么方案?UMI 精度争议如何解决?

韩磊:采用自研 UMI 方案。若学习目标是世界变化规律,无需全局绝对精度,UMI 完全够用。团队在 VIO 领域积累深厚,可进一步提升精度。

AI 科技评论:数据的“临界点”是什么?对突破时间乐观吗?

韩磊:确切数据量难定,我们正并行验证多套方案(Ego-centric、真机长/短程数据)。我对突破持乐观态度:四层架构设计合理,数据采集三线并进(众包 + 工厂 + 家庭部署),且通过仿真器与真机分层闭环验证提升迭代效率,有望加速物理 AGI 到来。

算力困局:快慢推理与端侧芯片

AI 科技评论:端侧芯片方案及切换计划?

韩磊:目前使用英伟达 Orin,后续计划切换至地平线征程 6,主要出于成本考量。

AI 科技评论:智驾芯片能否扛住机器人短程高交互场景?

韩磊:可采用“快慢系统”策略。首帧图像由慢系统完整计算(约 200ms),后续连续帧复用结果进行快推理(延迟压缩至 10-20ms)。S3 任务规划层可慢(1Hz),但高频响应环节必须在本地完成,云端网络延迟无法满足需求。

AI 科技评论:CoT(思维链)在机器人领域有用吗?

韩磊:CoT 思路实用,测试时优化(Test Time Optimization)亦是方向。若算力充足,可生成多个候选动作并挑选最优执行。算力是根本制约,一旦取得质变,世界模型能力将迎来飞跃。

03 争议点:跨本体与多模态

跨本体学习:噱头还是趋势

AI 科技评论:同一套模型在不同形态机器人(四足、轮式、人形)上效果差异大吗?

韩磊:差异确实很大,但“一脑多用”是必然路线。我们通过 S0 层模块处理本体差异,核心瓶颈在于算法如何实现泛化与对齐。

AI 科技评论:具体算法优化思路?

韩磊:基础思路是将动作表征为末端抓取点在空间的位移,而非直接控制关节角度。若末端执行器差异巨大,可迁移的主要是“世界物理规律”,而非“操作细节”。

AI 科技评论:四足数据向人形迁移可行吗?本体运动与操作的区别?

韩磊:工程经验可复用,但数据直接迁移有限。本体运动(Locomotion)主要依赖仿真,难度可控;操作(Manipulation)涉及与外部世界交互,需世界模型支撑,是真正的难点。

触觉与灵巧手的价值

AI 科技评论:加入触觉数据后模型效果变差,是世界模型的问题吗?

韩磊:这是 VLA 训练范式的问题。VLA 架构不擅长多模态融合。而原生多模态的世界模型架构(如混合 Transformer),可为不同模态配置专属编码,避免相互干扰。

AI 科技评论:灵巧手与夹爪的差距?

韩磊:从第一性原理看,学习世界物理知识(5B 参数量级)难度远高于适配灵巧手或夹爪(1 亿参数以内)。

04 价值唯一衡量标准

Benchmark 与行业“外挂”

AI 科技评论:行业有无公认 Benchmark?打球类演示水分大吗?

韩磊:目前暂无具备公信力的横向对比 Benchmark。关于球类演示,行业红线是不依赖 Vicon 光学动捕系统辅助。若借助动捕输出轨迹坐标,相当于作弊,失去了展示机器人自身感知预测能力的意义。真正的评判标尺,是产品在真实市场中的表现。

05 行业竞合与未来

AI 科技评论:大厂经历对您做具身智能的最大启发?

韩磊:最大的帮助是抓住事物本质:探索更适配机器人场景的表征方式。在大疆和华为的经历让我意识到,人工规则难以规模化,数据驱动的核心在于高效的世界表征。优质表征可降低对数据和算力的依赖,提升泛化能力。求之科技目前采用的运动轨迹表征,在推理效率与边缘端部署上均优于像素级方案。

在对话中,韩磊鲜少提及竞争对手,这份克制或许比技术争辩更有意义。在充斥 PPT 融资与 Demo 内卷的赛道,求之科技展现了一种不同的姿态:不讲最大的故事,专注做最小的闭环。

//

推荐阅读

国内第一视角数据最早押注者,北大卢宗青:隐空间才是具身的路

对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型」

未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8882
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读207.0k
粉丝0
内容8.9k