大数跨境

重磅!力压Gemini,中国开源全新交互AI模型

重磅!力压Gemini,中国开源全新交互AI模型 新智元
2026-09-10
1

「麻烦你,帮我看一下。」

一副 AI 眼镜的价值,可能就藏在少说一次这样的话里。对于视障用户而言,他们需要的不是一个能闲聊的 AI,而是一个能精准感知环境、在关键时刻提供辅助的帮手。

在本次 JDD 京东全球科技探索者大会上,京东展示了接入 JoyAI-VL-Interaction 模型的 AI 眼镜。该设备通过第一视角持续理解周围环境,旨在为全盲及低视力人群减少「必须问人」的时刻。这副眼镜不仅是充满人文关怀的智能硬件,更是观察京东 AI 从数字世界走向物理世界战略的重要切口。

JDD 期间,京东发布并开源了 JoyAI-Echo WM 实时可交互世界模型,并带来了一整套面向物理世界的模型矩阵升级。从看懂环境到判断回应时机,再到预测行动后果,一副眼镜背后展开的是京东从屏幕走向真实世界的完整技术布局。

难点不在看懂,在什么时候开口

在可穿戴设备的场景下,传统聊天框的交互逻辑不再适用。当用户走在马路上,车辆倒车、台阶障碍、路人招呼等多重信息同时涌入,AI 必须具备自主判断能力:哪些需要立即提醒,哪些可以暂时忽略,何时介入才不会干扰用户。

过去两年,行业竞争焦点在于模型回答的准确性。然而在第一视角交互中,首要难题是「该不该开口」。传统方案通常采用「传感器识别 + 规则引擎 + 语言模型」的拼凑式架构,不仅环节多、延迟高,在复杂动态环境中极易出现误报或失语。

京东推出的 JoyAI-VL-Interaction 选择了截然不同的技术路径。

这是一个 8B 规模、以视觉为核心的交互模型,也是全球首个全栈开源的 interaction 模型系统。它在架构层面将感知、推理和交互决策融合于同一模型内,摒弃了外挂检测器和规则引擎的传统做法。

该模型能对持续视频流进行实时理解,自主决策发言时机,将响应速度压缩至亚秒级。面对需调用工具或深度推理的复杂问题,系统会异步委托后台 Agent 处理,确保前台交互不中断。

京东集团副总裁、京东探索研究院副院长段楠表示,这是全球首个开源且能实现真正实时自主交互的多模态理解大模型。在 58 项真人盲评中,其对比豆包视频通话助手胜率达 77.6%,对比 Gemini 胜率达 87.9%,刷新了流式交互模型领域的最佳效果。

这标志着 AI 范式从「被动问答」向「持续在场」的切换。AI 不再仅等待提问,而是主动决定何时说话、说什么,以及如何调度后台资源。这一由眼镜逼出的技术突破,正是京东探索研究院近年来在物理 AI 领域深耕的成果。

屏幕里的聪明,不够用了

当 AI 通过可穿戴设备持续凝视真实环境,其所需能力已超越单纯的图文理解。理解、生成、实时交互、世界建模与具身操作,缺一不可。否则,机器只能停留在屏幕内的「聪明」。

段楠博士指出,相比数字 AI,物理 AI 不仅需要物理数据的规模化,更需要持续学习的规模化、物理基础模型的突破,以及全新的硬件规模化协同维度。数据、模型、算法与硬件四轮驱动,方能走进物理世界。

这正是 JDD 期间京东集中展示 JoyAI 基础模型矩阵的逻辑起点。物理世界天然需要一整套协作的能力栈:

  • 生成视觉内容(JoyAI-Echo LongVideo、JoyAI-Image-Edit);
  • 实时编辑视频(JoyAI-Video-Edit);
  • 语音交互(JoyAI-Voice 2.0、JoyAI-Talker);
  • 理解并模拟世界运行规律(JoyAI-Echo WM);
  • 落地机器人操作(JoyAI-RA)。

每个模块独立成章,组合起来则构成一条从「看见」到「动手」的完整链路。其中,JoyAI-Echo WM 尤为关键。

让 AI 先在脑子里把路走一遍

所谓世界模型,即让机器人在行动前,先在脑海中模拟「如果往前走三步、伸手拿杯子」的过程。若物理规则正确、碰撞检测真实,无需实际执行即可预判动作可行性。京东在这一方向的探索成果即为 JoyAI-Echo WM。

如果说视频模型侧重物理保真度(模拟世界如何运转),JoyAI-Echo WM 则侧重交互保真度(模拟人进入世界后环境的响应)。作为一个实时可交互世界模型,它能根据用户控制信号持续生成并动态调整画面与声音。在 WBench 导航评测中,其综合分达 81.7,交互得分 87.2,位居前列。

更关键的是,它生成的不仅是画面,环境声、音乐、语音均随画面同步演化,构建出一个可「走入」的沉浸式世界,而非播放即止的视频。

JoyAI-Echo WM 作为沉浸式环境的交互引擎,其技术根基源于 JoyAI-Echo 在长程视频多模态记忆、音画同步及后训练上的关键创新。

2026 年,世界模型赛道竞争加剧。京东的差异化优势不在于模型参数量,而在于手握仓库、门店、产线等真实的非标物理场景。能在这些无预设布景、无标准灯光的复杂环境中跑通世界模型,才是通往物理智能的真正门票。

从模型到真实世界:数据闭环和行业落地

基础模型矩阵是能力的心脏,而要走进物理世界,还需打通数据验证与真实业务两条管道。

在数据层面,京东同步展示了 EgoLive、JoyAI-Sim 和 JoyAI-RA 0.5 三项成果:

  • EgoLive:目前开源标注规模最大的第一人称数据集,专注于真实世界任务导向型人类日常活动
  • JoyAI-Sim:仿真工具链,通过合成符合人类认知的数据,低成本评估机器人性能,补充极端或长尾场景;
  • JoyAI-RA 0.5:通用视觉 - 语言 - 世界 - 动作(VLWA)框架,通过双重动作对齐机制,结合物理动态先验与视觉语义,实现跨异构数据的规模化操作学习。

EgoLive 收录了 2000 小时 60fps 的高保真双目视频,涵盖 65866 段数据、346 个真实场景任务,覆盖仓储、家庭、药房等多种环境。JoyAI-Sim 实现了仿真与真机表现 90% 的一致性,效率提升 3.2 倍。

JoyAI-RA 0.5 位于链条末端,从人类视频中学习物理动态,提升机器人在真实场景中的操作稳定性。三者串联,构建了「采数据→建仿真→跑真机」的完整管线。

在业务落地层面,JDD 展示了零售、物流、健康、工业、政务五大行业模型,直面订单、病历、图纸和设备等真实需求:

  • 京医千询 3.0:在 HealthBench 双榜第一,具备自主阅片能力,3D 阅片准确率超 GPT-5.5 近 15 个百分点;
  • JoyIndustrial 2.0:经受超 10 亿次工业调用,VisCAD 1.0 打通文生 CAD 图至零件装配全链路,核心设计任务准确率领先通用模型 15%;
  • OxygenVLM 4.0:支撑图搜、素材质检等核心电商业务,物流超脑 3.0 与政务大模型亦深入各自业务流程。

AI 的用户,正在从人变成世界

纵观京东战略路径,清晰呈现为从数字智能到附身智能,再到物理智能的演进。

段楠系统阐释了京东对 AI 发展的判断:过去 75 年,AI 经历了专家系统、统计模型、深度学习及基础模型四次变革,本质是数据、算力和模型的规模化。如今,AI 正迈入第五次变革——从数字世界走向物理世界。

其路径明确:利用蕴含更多物理信息的数据训练全模态和具身基础模型,让模型与环境持续交互迭代,最终部署于各类物理硬件,辅助用户完成真实任务。

在此背景下,京东将技术体系划分为三部分:

  • 数字智能:深耕内容理解,在数字世界构建模型能力基石;
  • 附身智能:将 AI 模型部署于真实硬件,实现人与设备的自然实时交互;
  • 具身智能:将模型部署于具身本体,让机器人协助人类完成生产生活任务。

京东的底气源自其独有的丰富业务场景、海量具身终端、真实操作数据及完整反馈闭环。段楠还公布了未来三年里程碑:

  • 2026 年底:全模态实时交互模型达到世界顶级水准,夯实附身智能基础;
  • 2027 年:完成具身数据集规模化采集,具身模型在通用能力及垂域场景实现世界领先并落地;
  • 2028 年:JoyAI 基础模型矩阵广泛融入生活与生产,服务千行百业。

京东探索研究院打造世界一流 JoyAI 基础模型矩阵的目标,直指让 AI 从数字世界走进物理世界,助力京东成为全球最大的物理世界运营中心。

这一愿景背后,是采数据、建仿真、修机器、跑流程等看似笨重却不可或缺的基础工作。正是这种深耕真实业务的「笨重」,构成了京东难以复制的护城河。京东的模型从诞生之初便浸泡在仓储、物流、零售、健康等真实场景中,而非实验室的 Demo。

过去,AI 的用户是屏幕前打字的人,问题有边界,对话有终点。现在,AI 的用户变成了这个永不停歇、不断变化的世界。没有人出题,也没有交卷时间

文章开头那副眼镜帮一个人看清了眼前的路,而京东想做的是让模型看清整个物理世界。从鼻梁上的一副眼镜,到全球最大的物理世界运营中心,这条路虽长,但方向已然清晰。

【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16533
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读390.3k
粉丝0
内容16.5k