上午接待一个基金的咨询单,聊了聊具身智能的发展情况,有几个重点也分享给大家,说到哪算哪。
011、中美分工不一样
全球具身市场主要集中在中美,美国大脑类的公司走得快,中国本体公司走得快。
022、中国手里有一张别人没有的牌
中国有一个非常重要的物理数据优势,就是制造业数据场景,这个是美国不具备的。
也就是说,中国拥有触达全球最高质量世界模型数据的优势,数据体量和质量会好于美国。
033、钱不在最难的那一档,也不在最卷的那一档
行业对于具身智能走完全非结构化场景是不看好的。
反而比较看好的是半结构化场景——比如仓储物流、便利店、药店这些。
而完全结构化场景(主要是工业场景)已经太卷了。
三类场景的冷热:最难的没人看好,最卷的进不去,中间那块才是共识
044、具身也有数据飞轮,已经有人转起来了
具身领域也有一个物理世界的数据飞轮。
目前走通这个路径的国内玩家:智元、银河通用、星河图;国外的典型玩家:Tesla Optimus、Waymo 等。
这些玩家基本上都有一定的真机装机量,且在场景里在跑,每天能够收集不少物理真机数据。
055、模型侧已经收敛了
目前各家基本上将 WAM + VLA 模型融合在一起用,已经是标配了。
这个在 26 年 1 月份就预测过了。
066、大脑值得关注谁,以及一句劝告
国内具身大脑上值得关注的公司有蚂蚁的 lingbot 系列,国外值得关注的有 Skild 等,这些都是做大脑的一脑多机路线。
蚂蚁的大脑有一个优势就是医疗、消费这些场景,是其他公司不具备的。
所以——不要贸然纯做大脑,还是要有一定的场景基础。
077、怎么判断一个机器人好不好用
目前评测这些机器人好不好用,有两个维度:
- ▪
一个是看固定几个动作在足够长的时间里,人介入次数的多少; - ▪
二是看多个动作最终的准确率。
第二个维度值得展开一下,因为它反直觉:假如有 10 个动作、每个动作 95% 的准确率,最终准确率就下滑到不到 60%。
单点准确率看着都很高,连起来就崩了——这是长任务链的真实门槛
这就是为什么 demo 里单个动作漂亮、真进场景就不行的原因:长任务链会把每一个小误差乘起来。
088、数据链的真相:七成数据是没有 action 的
数据链上,大多数预训练公司的数据主要有 70% 用的是互联网的视频数据(缺乏 action)和第一视角的数据(ego、umi 等),剩下的一小部分才是真机和仿真数据(涵 action)。
所以像智元、星河图这种已经在场景侧搞了很多真机在一线的,基本上已经形成物理世界模型的数据飞轮了。
别人后期再追就很难了。
七成数据没有动作标签,真正稀缺的是那一小块带 action 的真机数据
099、最后说说宇树
宇树目前只有出货量,没有形成物理世界模型飞轮,或者说它不做大脑。
加上它的数据场景主要在表演和实验室,这些无法拿到优质的场景物理数据,所以相比于其他家还是有些弱。
不过未来如果它跟大脑公司(比如蚂蚁灵波)合作的话,是另外一番景象。

