大数跨境

国内第一视角数据最早押注者,北大卢宗青:隐空间才是具身的路

国内第一视角数据最早押注者,北大卢宗青:隐空间才是具身的路 AI科技评论
2026-08-11
10
导读:具身智能的确定性技术还没出现,世界模型可能也不是答案。
具身智能的确定性技术尚未出现,世界模型或许并非终极答案。

作者丨邓哲敏

编辑丨齐铖湧

2025 年 6 月,北京大学计算机学院长聘副教授卢宗青在智源大会上提出核心判断:人类第一视角视频,是具身智能唯一可规模扩展(Scale up)的数据路径。

当时行业焦点多集中于机器人本体、素材场搭建及数据飞轮,鲜有模型公司关注人类第一视角视频。卢宗青不仅提出该论断,更据此方向积累了超过 50 万小时的高质量数据。

作为国内隐空间路线最早的系统性推进者,卢宗青于 2025 年创立 BeingBeyond(智在无界),选择了与主流视频生成截然不同的技术路径——隐空间世界动作模型(Latent World-Action Model)。该路线不生成像素画面,直接在嵌入空间(embedding space)联合预测机器人动作与世界响应。

此路线训练成本仅为视频生成路线的约 1%,推理速度足以支撑实时控制,但因缺乏可视化画面,在融资与 Demo 竞赛激烈的当下,极具挑战。

卢宗青对此保持清醒:具身基础模型的确定性技术范式尚未确立,当前的世界模型可能也非最终答案。他指出,GPT 的成功源于 Transformer 与 Next Token Prediction 确立了确定性范式,而具身智能目前“连确定性技术是什么都不知道”

2026 年 7 月 28 日,BeingBeyond 正式发布全球首个隐式触觉世界动作模型 Being-H0.8。该模型首次将触觉模态引入大规模预训练,统一视觉、触觉、动作及未来状态变化至同一隐空间,赋予机器人对物理交互过程更完整的认知与预测能力。

围绕技术路线抉择、数据价值、行业分工及通用具身基础模型的未来,AI 科技评论与卢宗青展开深度对话。

从北大到创业:纸上的东西不会自己变成产品

▎AI 科技评论:作为北大教授,您为何选择此时投身具身智能创业?今年学术界出身创业的现象似乎尤为普遍。

卢宗青:这并非突然转变。学术研究可验证方向可行性,但无法直接转化为产品。具身智能尤其需要真机验证与真实场景迭代,这是高校环境难以提供的。创业是让研究落地的必要方式,而非切换赛道。

▎AI 科技评论:部分创业者抱有“不融就来不及”的焦虑,您是否有同感?

卢宗青:我们的目标是构建具身基础模型(Foundation Model),这需要学校难以企及的算力、人才及产业生态支持。出走是为了成事,而非出于恐慌。

当前资本市场偏短线,部分融资存在估值炒作现象。我们坚持筛选长期主义的投资人,因为需要三到五年才能见真章的技术,必须匹配长周期资金,短期热钱只会扭曲技术决策。

隐空间 vs 像素:一场成本差了 100 倍的赛跑

▎AI 科技评论:行业内“世界模型”概念泛化,您如何界定具身领域的世界模型?

卢宗青:世界模型需落脚于具体领域。语言模型是语言领域的世界模型,3D 生成是空间领域的世界模型。对于具身智能,能控制输入输出动作的基础模型,即为具身领域的世界模型。

▎AI 科技评论:具身技术路线分歧明显,您如何看待基于视频生成与隐空间预测的差异?

卢宗青:从 Backbone 划分主要有两类:一类基于视频生成模型,后训练输出动作;另一类不生成画面,直接在 Embedding Space 预测状态与动作。

视频生成路线存在两大瓶颈:

一是训练成本极高。预测每个像素需数万张卡运行数月,成本达数亿级别,阿里 Wan 团队遇到的困境即为例证。

二是难以满足真机实时性。机器人决策需毫秒级响应,视频生成耗时过长会导致错失时机。

相比之下,隐空间路线优势显著:

1.成本优势:同等数据与参数下,算力成本约为像素生成模型的 1%,相差两个数量级。

2.物理规律学习:摆脱像素级监督信号的束缚,更易学到本质的物理关系与因果逻辑。

▎AI 科技评论:隐空间路线缺乏可视化 Demo,在融资环境中是否处于劣势?

卢宗青:演示与落地是两回事。接不住球的机器人画面再美也无用。虽然隐空间路线展示难度大,但其目标明确、贴近产业,这正是理性投资人看重的核心价值。

数据战略:比行业早两年布局人类第一视角

▎AI 科技评论:您早在 2023 年就判定人类第一视角视频是关键数据路径,依据是什么?

卢宗青:机器人本体采集数据量少且多样性不足,仿真环境构建成本高且覆盖有限。训练通用基础模型的核心在于数据多样性。人类日常生活的第一视角视频,是唯一同时满足高多样性、大数据量且易于 Scale up 的数据源。

▎AI 科技评论:目前数据积累规模如何?

卢宗青:截至 Being-H0.8 发布,已积累超过 50 万小时高质量数据。这些数据经过严格筛选,剔除重复,确保多样性。市场上存量数据能达到百万小时级别的公司极少。

▎AI 科技评论:如何看待通过量产设备构建“数据飞轮”的模式?

卢宗青:这对平台型公司是优势,但对初创公司则是陷阱。自建闭环易导致模型过拟合特定构型,无法实现通用化。对于志在 AGI 的企业,仅靠自家本体数据天花板显而易见。

▎AI 科技评论:贵司数据壁垒体现在何处?

卢宗青:壁垒在于强大的数据基础设施。从标注、筛选、对齐到评测、管理,这套全栈体系支撑了模型从 0.5 到 0.8 的快速迭代,是推动规模化数据沉淀与能力进化的关键。

行业洞察:确定性技术尚未出现,分工将是必然

▎AI 科技评论:许多公司选择先做场景化 SFT 卖本体,您如何看待这种模式?

卢宗青:天花板太低。单场景表现差异不大,真正的护城河在于预训练模型。优质的预训练模型可将下游数据需求降低一个数量级,并实现跨构型泛化,这是单纯后训练无法实现的。

▎AI 科技评论:灵巧手市场现状如何?

卢宗青:高价产品仅限科研市场,低价产品缺乏模型驱动则无用武之地。在模型未突破前,硬件降本逻辑难以成立。

▎AI 科技评论:智在无界的定位是什么?

卢宗青:我们专注操作类基础模型,本体公司是我們的客户。具身智能产业链条长、技术未收敛,必将形成专业分工。我们不做四足,专注于人形、机械臂及灵巧手的模型赋能。

▎AI 科技评论:对未来 3-5 年的行业节奏有何预判?

卢宗青:两到三年内将看到真正具备商业 ROI 的落地场景;三到五年有望推出类似 GPT-3.5 阶段的具身基础模型,实现跨形态、跨场景的通用任务处理。

▎AI 科技评论:通往 1.0 版本的关键赛点在哪里?

卢宗青:关键在于找到确定性的技术范式。如同 Transformer 之于 LLM,具身智能目前尚无此类范式。未来几年不仅是数据积累期,更是算法与训练方法寻求突破的关键期。

Being-H0.8 标志着从视觉到触觉、从观察到理解交互的重要进化。智在无界正以前所未有的训练范式,加速迈向通用具身基础模型的 1.0 时代。

//

推荐阅读

未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8891
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读210.6k
粉丝0
内容8.9k