导读
具身智能领域迎来双重突破:Om AI 联汇宣布完成数亿元融资,由前海母基金领投;同日,其旗下全球首款端侧原生模型 VLX-Seek 1.5 正式开源。这一组合拳标志着物理 AI 正从“云端依赖”向“端侧原生”范式迁移,旨在解决机器人落地中的延迟、成本与隐私痛点,重塑行业基础设施格局。
全球物理 AI 图谱更新:端侧原生填补关键空白
过去几年,AI 竞争聚焦于更大的参数规模与更强的云端算力。然而,当 AI 深入工厂、家庭等真实物理场景,单纯的参数量已非唯一指标。低延迟、可承受的端侧算力、规模化部署成本以及离线运行能力,成为决定模型价值的关键。
在物理世界,每一台终端设备都对应着真实的硬件、能源与维护成本。
纵观全球物理 AI 发展路线,各大巨头策略各异:NVIDIA Cosmos 主打“云端世界模型”,构建空间认知基础;Physical Intelligence 探索“云端通用机器人策略”,追求跨任务泛化;Google Gemini Robotics 推进“云端 VLA",连接语言与动作;Tesla Optimus 则强调“模型与本体闭环”。
然而,上述路线多未直接回答一个核心问题:如何让 AI 模型从诞生之初就适应端侧环境?这正是 Om AI 联汇通过自研 VLX 端侧流式多模态模型系列所填补的空白。
VLX 系列坚持“端侧原生”路线,不依赖云端大算力,亦不绑定单一硬件。其核心理念并非将云端大模型压缩后部署,而是在架构设计阶段即将端侧算力、延迟、功耗及成本作为硬性约束。这代表了两种截然不同的技术哲学:前者追问“如何让强大的 AI 跑在设备上”,后者思考"AI 生来就在设备上应是何种形态”。
随着机器人大规模进入工业与家庭场景,脱离对远端云端大脑的依赖已成必然。端侧原生正成为物理 AI 竞争的新高地,而 Om AI 联汇率先完成了这一关键拼图。
拆解“端侧原生”:从迁移部署到架构重构
传统方案通常采用“迁移式部署”:先训练云端大模型,再通过蒸馏、量化等手段适配端侧。这种方式本质上仍受限于云端逻辑,仅是在做“减法”。
Om AI 联汇的 VLX 模型则从架构层重构,将延迟、功耗等作为设计前提而非优化目标。这种“天生适合端侧”的架构,赋予了物理 AI 更快的响应速度、更低的部署成本及更强的自主性,使其能够真正胜任全天候工厂作业、无网环境巡检及高隐私要求的家庭服务。
端侧原生不仅是概念创新,更是一条决定物理 AI 能否大规模落地的新架构路线。其实际效能需经技术验证,而 VLX-Seek 1.5 的表现给出了肯定答案。
3B 模型性能实测:架构优势碾压同规模竞品
VLX-Seek 1.5 提供 3B 与 10B 两个版本。若说端侧原生是战略选择,那么“流式多模态”则是其以小博大的战术核心。
传统 VLM(视觉语言模型)多采用“批处理模式”:拍照、上传、推理、返回。这种模式存在高延迟、高带宽依赖及隐私风险,且将连续感知割裂为静态快照。相比之下,VLX-Seek 1.5 采用流式多模态架构,接收视频流持续输入,在端侧实时理解并动态输出决策,构建了"Flow(持续注意力)-Seek(精细推理)-Go(执行控制)”的完整心智闭环。
评测数据显示,VLX-Seek 1.5 在多项关键指标上超越同量级竞品(如 NVIDIA LocateAnything-3B):
- 通用目标检测:在 LVIS Mean 指标上,VLX-Seek 1.5-3B 达到 57.5,较竞品提升 13.4%,证明小参数模型在复杂长尾目标识别中并未退化。
- 指代表达理解:在 RefCOCOg test Mean 任务中,得分 80.2,提升 3.4%,展现了更强的视觉 - 语言深层关联能力。
- 无人机视角感知:在极具挑战的 RefDrone 测试中,F1 指标达 73.2(提升 40%),实例准确率 Acc 达 58(提升 62.9%),显著优于传统模型。
此外,针对物理 AI 最忌讳的“幻觉”问题,VLX-Seek 1.5 引入目标幻觉指标(Object Hallucination)。在 RefDrone 评测中,其 FP/GT 值仅为 18,远低于竞品的 71.3。这意味着模型在信息不足时能准确判断“不知道”,大幅降低误报风险,这对于安防、巡检等高可靠场景至关重要。
融资开源双轮驱动,构建端侧智能生态
资本市场的快速反应印证了端侧原生范式的价值。Om AI 联汇此次获数亿元融资,类比云原生早期,投资人押注的是范式迁移本身及标准定义权。
通过开源 VLX-Seek 1.5,Om AI 联汇旨在推动行业标准共识的形成,类似 Kubernetes 的发展路径:以免费标准建立生态壁垒,进而通过基础设施与托管服务实现商业价值。目前,基于 VLX 基座的“一脑多形”智能体平台 OmAgent 正在加速落地。
商业化方面,具身智能产品 OttoPlex 御行已投入应用;消费端携手联想、苹果推出 AI PC"OttoBox AI Studio";自研可穿戴视觉中枢 Homer AI 已服务近 10 万视障用户,月均调用量达千万次。
从云计算到云原生的演进表明,产业跃迁的核心在于架构革新而非单纯堆砌算力。如今,物理 AI 正处于相似的历史节点。融资是资本的投票,开源是生态的接入。当模型真正离开云端,嵌入万千终端,端侧原生或将成为物理 AI 规模化爆发的关键钥匙。未来的赢家,未必是参数最多的模型,而是能让机器人在真实世界中高效、安全运行的基础设施。

