大数跨境

智元全模态大模型,登顶全球第一!力压谷歌英伟达,跑赢大厂

智元全模态大模型,登顶全球第一!力压谷歌英伟达,跑赢大厂 智东西
2026-07-29
7
导读:三智一体不断演进,开启具身智能新未来。

三智一体不断演进,开启具身智能新未来。
作者 |  江宇
编辑 |  漠影
当机器人置身于嘈杂的多人交谈场景,能否精准识别对话对象、判断回应时机?能否在对方停顿时自然接话,被打断后流畅续接?甚至一边回答,一边配合语气做出恰当的手势与表情?这些看似寻常的交流细节,正是具身智能跨越自然交互门槛的核心难点。
长期以来,机器人行业面临“单项能力突破易,整体协同难”的困境:感知、推理、语音、动作往往各自为战,难以在同一时间轴上高效协同。近日,智元自研全模态大模型 WITA-Omni Preview 给出了突破性答卷。
在具身全模态理解权威榜单 DailyOmni 上,WITA-Omni 以 85.21 分的综合成绩登顶,超越千问、Gemini、豆包、英伟达等国内外领先模型,并在八项细分指标中斩获六项第一。
在“看懂环境、听懂声音、边听边想、边说边动”的核心交互主线上,这家专注具身智能的企业已跑在通用大模型厂商之前。此前,智元世界模型 Genie Envisioner-Sim 2.0 已在 WorldArena 赛道拿下总分第一。此次 WITA-Omni 的登顶,标志着智元在构建“交互 - 作业 - 运动”三位一体的自研 AI 版图上迈出了关键一步。

01. 一场“声画对位”的大考:DailyOmni 如何检验全模态能力

“能看图 + 能听声”并非真正的全模态。真正的挑战在于,当声音与画面同时涌入时,模型能否厘清说话主体、事件时序及关键细节,实现“边听边看边想”的同步协同。DailyOmni 评测正是对准这一难点,采用真实开放环境的音视频数据,重点考察声画对应、事件时序判断及跨模态联合推理能力。
与依赖单一模态先验的图文评测不同,DailyOmni 要求模型必须同时调动视听信息。WITA-Omni 在此交出了优异成绩单:综合得分 85.21 分登顶,其中音视频对齐 86.13 分、事件时序 84.64 分、综合推理 85.06 分,并在长时序视频理解任务上表现领先。其在“声画对齐、时序判断、跨模态推理”主线上建立了系统性优势。
同台竞技者多为千问、Gemini、英伟达等通用大模型厂商的旗舰产品,智元作为少有的“具身智能赛道选手”脱颖而出。这不仅证明了从机器人原生交互场景出发构建全模态能力的技术路线具备强大竞争力,也标志着智元的 AI 大模型能力已跻身与大厂同台竞技的第一梯队。

02. Thinker–Talker–Actor:让机器人边想边说边动

传统机器人交互采用串行流水线架构:识别语音、理解语义、生成回复、合成语音、输出动作。这种模式存在响应延迟累积、语义转换损耗以及多模态节奏不同步(如嘴笑手未动)三大天然缺陷,导致机器人难以具备人类般的自然感。
WITA-Omni 从架构根源打破了这一范式。它在 Thinker–Talker 基础上扩展出 Actor 模块,将动作和表情提升为与语音并列的一级输出:

核心架构解析

  • Thinker(多模态推理核心):将文本、图像、音频等映射到统一空间,进行跨模态联合推理与高层决策;
  • Talker(语音生成):以 Thinker 隐状态为条件,流式生成自然语音;
  • Actor(动作与表情驱动):由动作头与表情头组成,不仅接收语义状态,还以 Talker 的音频隐变量为条件,实时感知语速、停顿与情绪变化。
三大模块在统一时间轴上同步推进,配合跨流同步机制,实现了手势、表情与语音的实时响应。这种“原生”架构将“理解”与“表达”融合为同一生成过程的不同维度,重新定义了全模态模型结构,体现了具身智能公司的差异化竞争力。

03. 千万小时中训练 + 千小时高质量后训练:具身数据的“炼钢术”

具身智能的数据难题在于公开数据缺乏交互轮次、响应时机及时序标注。WITA-Omni 的领先得益于一套围绕具身全模态交互构建的分层数据体系与针对性训练方法。

分层数据体系

在中训练阶段,模型使用了千万小时级多模态数据,配比经过精心设计:约四成音视频联合数据用于训练声画对应关系;三成纯音频数据强化语音与环境声理解;其余为视觉与文本数据。这一阶段聚焦解决“声音来源、事件时序、跨模态推理”三大核心问题。
针对公开数据的不足,智元自建了面向真实交互场景的大规模高质量全模态数据集,主要来源包括:
  • 带有同步语音、动作和面部表情的人机/人人交互视频,标注轮次切换与响应时机;
  • 机器人遥操作过程中采集的第一人称感知与动作数据;
  • 经半自动流水线转化的带有多维标注(说话人、动作、事件、指令等)的监督样本。

SFT–OPD–RL 三阶段后训练策略

在千小时级高质量数据上,WITA-Omni 采用了进阶训练策略:
  • SFT 监督微调:建立基础的全模态理解与多流生成能力;
  • OPD 同策略蒸馏:利用拥有特权信息(如时间区间、目标对象)的“老师模型”生成高质量答案,蒸馏至不依赖特权信息的“学生模型”,提升上下文推理能力;
  • RL 强化学习:重点优化交互决策,奖励信号覆盖可验证答案、时间匹配、目标选择及主动触发准确率,通过 GRPO 优化模型策略。
由此,模型不仅学会“回答正确”,更学会了在真实场景中判断“该不该回应、何时回应、回应谁”,实现了音视频联合理解、交互决策与同步表达的深度融合。

04. 不仅要“想得准确”,更要“聊天像个人”

理解准确仅是及格线,交互智能的高标准藏在细节中:不乱插嘴、适时沉默、自然接续。WITA-Omni 在语音交互侧同样表现出色。在国际权威评测 Artificial Analysis 的 Speech Arena 基准测试中,智元在衡量语音推理的 Big Bench Audio 与衡量全双工对话能力的 Full Duplex Bench 子集上均取得第一,超越 GPT-Realtime 等闭源商用模型。

▲衡量语音推理的 Big Bench Audio

▲衡量全双工对话能力的 Full Duplex Bench 子集

全双工对话要求模型同时听和说,实时判断语轮切换。WITA-Omni 在此项能力的领先,意味着其能在真实对话节奏中做出自然反应:该说时说、该停时停、被打断能自然衔接。这种“交互节奏感”是用户感知机器人是否“像人”的关键,也是具身智能在“自然表达”维度上的重要突破。

05. 结语:三智一体,领跑行业

智元始终围绕“作业智能、交互智能、运动智能”打造“三智一体”的差异化竞争力。其中,运动智能是物理执行基础,作业智能提供劳动生产力,交互智能则提供服务生产力。随着此前在 WorldArena 及 GO 系列基础模型上的领先,此次交互智能的全球登顶,完整拼上了智元 AI 版图的最后一块拼图。
2026 年是具身智能从开发态向部署态跨越的关键之年。机器人走进产线、门店和家庭,核心门槛在于三大智能的协同:运动智能决定能否进入场景,作业智能决定能否完成任务,交互智能决定能否提供情绪价值与服务体验。WITA-Omni 的突破,让机器人距离真实世界的自然交互更近一步,也验证了智元“既有本体、更有 AI"的战略定位,为行业树立了新的标杆。
【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11763
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读200.0k
粉丝0
内容11.8k