Om AI 联汇正式发布 VLX-VR 视频推理模型,以 78.8% 的视频问答准确率登顶谷歌 DeepMind MINERVA 基准,超越谷歌 Gemini 3.5、OpenAI GPT-4.1 等国际旗舰模型。
2025 年 1 月,R1 强化学习训练框架点燃文本推理;同年 2 月,Om AI 联汇开源 VLM-R1 视觉推理模型,上线 12 小时收获 2000+ Star,48 小时登顶 GitHub 全球趋势榜,首次将 R1 强化学习推理框架引入视觉领域,实现范式突破。此后一年半,基于该范式的视觉推理方案在行业内广泛落地。
此次 VLX-VR 将推理能力从静态图片延伸至动态长视频,实现从定格瞬间感知到跨时长因果推演的能力跃迁, VLX 家族能力版图再添关键一环。模型推理逻辑一致性达 90.9%,视频不同时长准确率偏差仅约 1.1 个百分点,在 15 分钟以上长视频场景下性能保持稳定,突破了行业普遍存在的 “长视频性能下滑” 瓶颈。
物理世界在时间中流动,视频是承载时间、空间与因果的完整信息形态。看懂长视频,是物理 AI 的核心基础能力,也是智能终端从 “看清” 走向 “看懂” 的必经之路。VLX-VR 的发布,进一步拓展了 VLX 家族能力矩阵,为物理 AI 从技术验证走向产业落地筑牢了感知根基。
目前 VLX 线上体验平台已同步开放 VLX-VR 实测入口,欢迎体验。
官方体验平台:https://om-agent.cn/
更多技术细节
可以扫描下方二维码关注“VLX端侧流式多模态模型”公众号,添加VLX官方小助理,获取平台专属服务权限。
关注VLX公众号
添加VLX小助理
LINKER | 更多阅读

