大数跨境

通义千问 Qwen3.8-Omni-Flash:让音视频大模型具备自主任务交付能力

通义千问 Qwen3.8-Omni-Flash:让音视频大模型具备自主任务交付能力 苏哲管理咨询
2026-09-21
22
导读:Qwen3.8-Omni-Flash 是通义千问团队推出的原生全模态模型,核心定位是强化音视频为核心的 Agent 智能体生产力能力,目标让全模态模型从 “看懂音视频” 升级为自主规划任务、调用工具并

Qwen3.8-Omni-Flash 是通义千问团队推出的原生全模态模型,核心定位是强化音视频为核心的 Agent 智能体生产力能力,目标让全模态模型从 “看懂音视频” 升级为自主规划任务、调用工具并交付完整成果,现已上线千问平台,支持文本、图像、音频、视频输入,具备 1M 超长上下文窗口。

相比上一代 Qwen3.5-Omni-Plus,该模型在 29 项评测平均提升超 25%;成本大幅下降,音频输入每小时 API 价格降幅超 98%,音视频输入降幅超 93%。Agent 能力提升尤为突出:WildClawBench-MM 提升 36.5 分,AgenticVBench 提升 22.3 分,UniClawBench 取得 69.6 高分。音频能力整体超越 Gemini 3.8 Flash,音视频能力接近 Gemini 3.8 Flash。

模型最大创新是Agentic 长音视频理解。传统静态理解需要处理全部视频帧,而 Agent 模式从用户问题出发,由粗到细主动取证,只读取相关片段。在 OmniVideoBench 测试中,准确率从 63.4 提升至 67.8,Token 消耗下降 45.7%,大幅降低长视频推理成本。同时支持可控音视频 Caption,用户可自定义描述范围、粒度、输出格式,按需输出结构化内容,适配素材检索、内容创作、资产管理等不同业务。

在业务落地场景上,模型覆盖多条音视频生产端到端工作流。Music2MV 能够解析歌曲节奏情绪,生成带时间戳歌词与镜头方案,自动制作 MV;短剧翻译 Agent 可自动识别多角色台词、翻译、角色配音、音轨混合,实现短剧出海自动化;长电影解说可读取完整影片,提炼剧情、撰写解说文案、剪辑混音并质检成片。会议场景中,多说话人音画协同识别能力显著优化,AliMeeting 指标 DER/cpWER 从 88.11/89.61 降至 3.35/17.18,可完成参会人识别、纪要、待办提取,联动工具执行后续任务。

文章还展示了Agent 参与模型迭代的前沿实验:由 Qwen3.8-Omni-Flash 自主完成 Qwen2.5-Omni-3B 四川话识别优化,12 小时内构建训练数据、多轮实验调优,最终字符错误率由 25.79% 降至 15.30%,相对下降 40.7%,验证大模型驱动小模型业务定制的新范式。配套开源工具 Qwen-MM-Plugins 提供 Video2Note、Omni Skill Creator 等插件,可将教学视频转为 PDF 笔记、把操作演示提炼成可复用 Agent 技能;Qwen-Live Harness 面向实时交互场景。

同步推出 Qwen3.8-Omni-Flash-Realtime,支持音视频流实时感知响应,是首个具备听声辨位空间音频感知的全模态模型,可识别声源方位,结合视觉完成空间导航;同时支持实时口语陪练、动态注入业务 Skill,适用于实时客服等场景。API 兼容 OpenAI 协议,支持reasoning_effort三档推理深度调节,支持 74 种语言、39 种中文方言语音识别。

10 个关键 Q&A

  1. Q1:Qwen3.8-Omni-Flash 核心目标是什么?
    A:提升以音视频为核心的 Agent 生产力,从单纯理解多模态内容,走向任务规划、工具调用、交付完整成果。
  2. Q2:Agentic 长视频理解相比静态理解优势?
    A:主动定位关键片段,不用全量处理视频;准确率提升,Token 消耗降低约 45.7%,节省算力。
  3. Q3:可控音视频 Caption 是什么?
    A:用户自定义视频描述范围、细节粒度、输出格式,适配检索、创作、资产管理等不同需求。
  4. Q4:会议场景的核心改进?
    A:音画联合识别多说话人,大幅降低识别错误率,自动生成纪要、待办,联动工具执行任务。
  5. Q5:Music2MV 功能可以做什么?
    A:解析歌曲节奏情绪,生成镜头、场景方案,输出带时间戳歌词,完成 MV 创意与成片质检。
  6. Q6:短剧翻译 Agent 实现了哪些自动化环节?
    A:角色台词识别、口语翻译、角色配音克隆、音轨重混、成片质检,打通完整译制链路。
  7. Q7:Agent 优化小模型实验结果如何?
    A:12 小时内优化 Qwen2.5-Omni-3B 四川话识别,字符错误率相对下降约 40.7%。
  8. Q8:Qwen-MM-Plugins 包含哪些核心插件?
    A:Video2Note(视频转 PDF 笔记)、Omni Skill Creator(视频提炼 Agent 技能)、mdomni-memory 等。
  9. Q9:Qwen3.8-Omni-Flash-Realtime 独特能力?
    A:流式实时音视频交互,首个支持听声辨位的全模态模型,可感知声源方向距离。
  10. Q10:API 有什么特点?
    A:兼容 OpenAI 协议,支持reasoning_effort三档推理深度调节,音视频调用成本显著降低。



【声明】内容源于网络
0
0
苏哲管理咨询
为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
内容 2227
粉丝 0
苏哲管理咨询 为企业及组织提供AI+战略、数智化转型咨询及观点、建议等
总阅读48.7k
粉丝0
内容2.2k