大数跨境

英伟达塞进端侧,小米用10万小时砸数据墙:世界模型这一周都在卷

英伟达塞进端侧,小米用10万小时砸数据墙:世界模型这一周都在卷 ElephantMind.AIGC
2026-07-22
4
导读:同一周,物理AI在「能跑在哪」和「数据从哪来」两条线上同时加码。

具身智能和物理AI这周有个共同点:

大家不再只聊「更大的云端视频模型」,而是在追问两件更土、更硬的事——模型能不能跑在机器旁边,以及训练数据能不能先绕开「必须先有一堆真机」

NVIDIA放出开放权重的 Cosmos 3 Edge;小米发布机器人基础模型 Xiaomi-Robotics-1的项目页、论文与模型入口,代码和权重目前仍显示为即将释放。

两条线不互相替代,但叠在一起看,物理AI的下一截竞争地图会清楚很多:

一边在回答模型怎么落到边缘设备,另一边在回答机器人怎么凿开数据墙。

01Cosmos 3 Edge:把世界模型搬到边缘设备

据Hugging Face上的NVIDIA介绍,Cosmos 3 Edge是约 40亿参数的开放世界模型,目标是在工厂、仓储、医院等边缘场景里,让机器人与视觉Agent理解环境、实时推理,并在设备上生成动作。

它强调的不是「再做一个云端大玩具」,而是内存受限设备上的数据中心级能力

公开口径里,Cosmos 3 Edge 可在 RTX PRO、DGX、GeForce RTX,以及 Jetson 等硬件上做高吞吐推理;在机器人控制分辨率约 640×360的观测下实时推理;在 Jetson Thor上单次推理生成 32个动作,并实现约 15Hz实时控制。

这些数字真正指向的是一件事:

世界模型开始从云端演示,往边缘部署迁移。

过去很多视频模型证明的是「能不能生成一个看起来合理的未来画面」。 但机器人要的是另一件事:模型能不能在真实设备旁边持续理解环境变化,并参与动作闭环。

一个是「生成给人看」。 一个是「推理给机器用」。

这两件事不在一个层面上。

结构上,Cosmos 3采用两座互补的Transformer塔:自回归塔负责文本等离散token生成,扩散塔负责图像、视频、音频、动作等连续模态生成。它不是单纯把视频生成做大,而是试图把理解、预测、生成和动作推理收进同一套物理AI框架。

当然,这不等于它可以直接拿去控制真实机器人。

涉及机器人控制、自动系统和安全关键场景,仍然需要外部约束、系统级安全分析和领域验证。

但方向已经很清楚:

物理AI不能永远停在云端。

02小米Robotics-1:先用10万小时砸开数据墙

如果说 Cosmos 3 Edge 问的是「模型跑在哪里」,那小米 Xiaomi-Robotics-1问的是另一个更根上的问题:

机器人到底拿什么训练?

语言和视觉模型能靠缩放律往前推,是因为它们有海量文本、图像和视频。

但机器人不一样。

机器人需要的是动作数据。 它要知道手怎么伸、物体怎么抓、柜门怎么开、衣服怎么叠、环境状态怎么变化。

而这些数据没法像网页文本一样轻易获得。

你不能靠爬虫爬出一千万小时真实机器人操作数据。它需要真机、真实空间、真实任务、真实采集,也需要大量昂贵而缓慢的标注与对齐。

所以机器人基础模型长期卡在一个瓶颈上:

质量数据太少,真机数据太贵,缩放很难启动。

小米给出的路线是两阶段:

先做大规模 无本体数据预训练,再用少量真机数据做后训练对齐。

预训练侧,小米提到约 10万小时无本体轨迹,覆盖 1700+场景,包括家庭、商业、工业、户外等。这些长视频会被切段,再用强VLM自动标注「场景状态如何变化」,形成可规模化的语言—动作语料。

后训练侧,再用跨本体真机数据、筛选过的开源机器人数据,以及高质量UMI数据做对齐。小米还提到,自有真机数据超过 7200小时,来自真实家庭采集,任务包括整理沙发、鞋柜、厨具收纳等。

这套路线最值得看的是:

它试图把“缩放律”这件事,部分搬进机器人训练里。

过去机器人训练太依赖真机数据,所以很难像语言模型那样靠规模往前推。

Xiaomi-Robotics-1想绕开一部分限制:先不把训练完全绑死在某一种具体机器人上,而是先从大规模无本体轨迹里学习动作与状态变化的通用规律,再通过真机后训练,把能力钉回具体本体和真实任务。

所以它卖的不是又一个「会聊天的机器人人设」。

它真正指向的是:

机器人能不能先用大规模无本体数据获得操作先验,再用少量真机数据完成迁移。

03两条线,一张地图


Cosmos 3 Edge
Xiaomi-Robotics-1
核心卡点
云端能力如何落到边缘算力
真机数据太贵、太少,缩放难启动
主要打法
4B开放世界模型 + 
端侧实时动作推理
10万小时UMI预训练 + 
真机/指令后训练
解决问题
模型跑在哪里
机器人拿什么学
仍需验证
传感器、延迟、
控制频率是否吃得消
公寓演示和基准之外
陌生场景是否掉点

它们不是互相替代的关系,而是物理AI走向真实世界时必须同时回答的两个问题。

一个偏部署。 一个偏数据。

一个解决「跑在哪里」。 一个解决「拿什么学」。

过去看机器人,大家很容易被Demo吸引:会不会端茶、会不会叠衣服、会不会开柜门、会不会做饭。

但真正进入工程化阶段后,问题会变得更冷、更硬:

模型能不能低延迟运行? 边缘设备能不能承受? 动作闭环能不能稳定? 数据能不能持续积累? 陌生场景里掉点有多严重?

这些问题听起来没有那么性感。

但它们才是真正决定物理AI能不能落地的部分。

所以这周最值得看的,不是NVIDIA和小米谁更强。

而是它们同时指向了一个变化:

物理AI的计分板,正在从「谁家演示更炫」,换成「谁能在设备上稳跑,谁能把数据墙凿开一条缝」。

一个往边缘跑。

一个往数据里钻。

这一周,两边都交了作业。

【声明】内容源于网络
0
0
ElephantMind.AIGC
深耕视频处理与流媒体核心技术,紧跟全球 AIGC 发展浪潮。聚焦场景落地与技术方案输出,以视频 + AIGC 为创新底座,赋能内容生产、全链路应用与商业变现。
内容 20
粉丝 0
ElephantMind.AIGC 深耕视频处理与流媒体核心技术,紧跟全球 AIGC 发展浪潮。聚焦场景落地与技术方案输出,以视频 + AIGC 为创新底座,赋能内容生产、全链路应用与商业变现。
总阅读189
粉丝0
内容20