作者丨齐铖湧
编辑丨林觉民 董子博
世界模型是今年具身智能行业最热门的技术概念之一。从高校实验室到科技巨头,再到初创企业,各方势力纷纷入局。然而,关于“世界模型究竟是什么、能做什么、离落地还有多远”,业界尚无定论。在无锡,我们与求之科技世界模型负责人韩磊进行了一场深度对话。
韩磊拥有横跨学术与工业界的背景:曾参与大疆 Phantom 4 研发,赴港科大攻读博士,后在华为海思前沿实验室从事世界模型预研,现负责求之科技世界模型的全链路工作。求之科技由清华大学智能产业研究院副教授周谷越发起,近期已完成天使 + 轮融资。
对话中,韩磊坦率剖析了世界模型的技术分层、数据策略、算力瓶颈及行业乱象,并阐述了求之科技“不讲大故事,做最小闭环”的务实路线。
01 现状:定义之争与架构逻辑
世界模型的核心价值
AI 科技评论:今年具身智能公司都在讲“世界模型”,但定义差异极大。您关注这些定义之争吗?
韩磊:这更多是话术层面的区分。从业者不应陷入定义泥潭,核心问题只有一个:模型是否具备泛化能力。
AI 科技评论:如何理解这种泛化能力?
韩磊:工业场景标准化,传统控制算法或 VLA 即可胜任;但家庭场景是非标的(如桌椅摆放、光线变化)。以叠衣服为例,叠见过的衣服是工程问题,叠从未见过的新款式则是世界模型需跨越的鸿沟。实现真正泛化,需要底层架构突破及真实物理世界数据的支撑。
S0-S3 分层技术架构
AI 科技评论:求之内部的技术架构是怎样的?
韩磊:我们采用 S0 至 S3 的四层架构,旨在最快通向物理 AGI:
- S0(末梢):电机、定位等底层硬件模块;
- S1(小脑):负责具体动作输出,如抓取;
- S2(快脑):即世界模型层,负责预测未来状态变化;
- S3(慢脑):相当于大脑,负责任务拆解与调度(Agent)。
我负责的 S2 层世界模型,优势在于:兼顾多模态具身表征(触觉/视觉/本体状态),引入隐空间像素轨迹预测以提升可解释性与计算效率;原生适配 3D 视觉,通过双目观测显式输入 3D 信息;并与仿真器形成“模型越准→仿真越真→数据越丰富”的正向循环,持续减少 Corner Case。
AI 科技评论:分层架构会被误解为只能做短任务吗?
韩磊:事实相反。复杂任务是原子操作的组合。分层架构能聚合相似简单任务,最大化数据利用效率。即使在数据稀缺阶段,也能通过原子操作复用启动数据飞轮,加速物理 AGI 演进。
AI 科技评论:李飞飞提出“渲染器、模拟器、规划器”三合一,您认为会统一吗?
韩磊:长期看肯定会融合,但在现阶段,每个模块单独落地并产生商业价值更为务实。前提是各子模块能力足够强,正如 Agent 框架建立在强大基础模型之上。
具身公司的两种路线分野
AI 科技评论:行业存在两种风格:一种是极复杂的长流程 Demo,另一种是做短程高交互基础操作。您怎么看前者?
韩磊:长流程 Demo 如今已难令业内人士信服,常被质疑是过拟合的纯演示。我们更关注可泛化的机器人操作。无论长程还是短程,只要家庭场景有确切需求,我们都会做。但若小事不够鲁棒精细,长 Demo 意义有限。
AI 科技评论:从小任务做起会影响融资吗?资本喜欢大故事。
韩磊:关键在于方法的可扩展性。若为做小事而用规则驱动取巧,那是错的。我们要解决家庭场景下的复杂泛化问题,以实际解决问题为导向,而非以 Demo 为导向。
AI 科技评论:行业普遍采用分精度规则驱动(如米级识别、亚毫米级抓取),您怎么看?
韩磊:通用机器人的最大挑战是任务不确定性,必须靠数据驱动而非规则驱动。规则无法规模化,而世界模型通过预测未来表达动作逻辑,这条路才具备可扩展性。
02 我们的判断:仿真、数据与算力
仿真路线:DISCOVERSE vs Cosmos
AI 科技评论:贵司自研仿真器 DISCOVERSE 与英伟达 Cosmos 有何不同?
韩磊:DISCOVERSE 2.0 融合场景表征与物理引擎,核心目标有二:一是保证物理精确性,复用 MuJoCo 等成熟引擎保障刚体接触力与触觉仿真精度;二是兼顾渲染真实感与效率,作为全球首个基于 3DGS 技术的具身智能端到端仿真框架,可实现上万 FPS 并发渲染,完成端到端模型闭环验证。
AI 科技评论:各自优劣势是什么?
韩磊:Cosmos 优势在于通用性,但物理真实性存疑;UE5 路线则慢且贵。DISCOVERSE 的优势在于极高的渲染效率及真实的物理交互能力,能精确还原柔性物体动力学行为。虽在通用性上暂时不及端到端视频生成模型,但对机器人训练验证更具实用性。
数据策略:UMI 方案与临界点
AI 科技评论:无锡数采厂采用什么方案?UMI 精度争议如何解决?
韩磊:采用自研 UMI 方案。若学习目标是世界变化规律,无需全局绝对精度,UMI 完全够用。团队在 VIO 领域积累深厚,可进一步提升精度。
AI 科技评论:数据的“临界点”是什么?对突破时间乐观吗?
韩磊:确切数据量难定,我们正并行验证多套方案(Ego-centric、真机长/短程数据)。我对突破持乐观态度:四层架构设计合理,数据采集三线并进(众包 + 工厂 + 家庭部署),且通过仿真器与真机分层闭环验证提升迭代效率,有望加速物理 AGI 到来。
算力困局:快慢推理与端侧芯片
AI 科技评论:端侧芯片方案及切换计划?
韩磊:目前使用英伟达 Orin,后续计划切换至地平线征程 6,主要出于成本考量。
AI 科技评论:智驾芯片能否扛住机器人短程高交互场景?
韩磊:可采用“快慢系统”策略。首帧图像由慢系统完整计算(约 200ms),后续连续帧复用结果进行快推理(延迟压缩至 10-20ms)。S3 任务规划层可慢(1Hz),但高频响应环节必须在本地完成,云端网络延迟无法满足需求。
AI 科技评论:CoT(思维链)在机器人领域有用吗?
韩磊:CoT 思路实用,测试时优化(Test Time Optimization)亦是方向。若算力充足,可生成多个候选动作并挑选最优执行。算力是根本制约,一旦取得质变,世界模型能力将迎来飞跃。
03 争议点:跨本体与多模态
跨本体学习:噱头还是趋势
AI 科技评论:同一套模型在不同形态机器人(四足、轮式、人形)上效果差异大吗?
韩磊:差异确实很大,但“一脑多用”是必然路线。我们通过 S0 层模块处理本体差异,核心瓶颈在于算法如何实现泛化与对齐。
AI 科技评论:具体算法优化思路?
韩磊:基础思路是将动作表征为末端抓取点在空间的位移,而非直接控制关节角度。若末端执行器差异巨大,可迁移的主要是“世界物理规律”,而非“操作细节”。
AI 科技评论:四足数据向人形迁移可行吗?本体运动与操作的区别?
韩磊:工程经验可复用,但数据直接迁移有限。本体运动(Locomotion)主要依赖仿真,难度可控;操作(Manipulation)涉及与外部世界交互,需世界模型支撑,是真正的难点。
触觉与灵巧手的价值
AI 科技评论:加入触觉数据后模型效果变差,是世界模型的问题吗?
韩磊:这是 VLA 训练范式的问题。VLA 架构不擅长多模态融合。而原生多模态的世界模型架构(如混合 Transformer),可为不同模态配置专属编码,避免相互干扰。
AI 科技评论:灵巧手与夹爪的差距?
韩磊:从第一性原理看,学习世界物理知识(5B 参数量级)难度远高于适配灵巧手或夹爪(1 亿参数以内)。
04 价值唯一衡量标准
Benchmark 与行业“外挂”
AI 科技评论:行业有无公认 Benchmark?打球类演示水分大吗?
韩磊:目前暂无具备公信力的横向对比 Benchmark。关于球类演示,行业红线是不依赖 Vicon 光学动捕系统辅助。若借助动捕输出轨迹坐标,相当于作弊,失去了展示机器人自身感知预测能力的意义。真正的评判标尺,是产品在真实市场中的表现。
05 行业竞合与未来
AI 科技评论:大厂经历对您做具身智能的最大启发?
韩磊:最大的帮助是抓住事物本质:探索更适配机器人场景的表征方式。在大疆和华为的经历让我意识到,人工规则难以规模化,数据驱动的核心在于高效的世界表征。优质表征可降低对数据和算力的依赖,提升泛化能力。求之科技目前采用的运动轨迹表征,在推理效率与边缘端部署上均优于像素级方案。
在对话中,韩磊鲜少提及竞争对手,这份克制或许比技术争辩更有意义。在充斥 PPT 融资与 Demo 内卷的赛道,求之科技展现了一种不同的姿态:不讲最大的故事,专注做最小的闭环。

国内第一视角数据最早押注者,北大卢宗青:隐空间才是具身的路
对话 IDEA 张磊:「不以动作为输入条件,就不叫世界模型」
未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

