全SOTA!不止纯文本,阿里多模态站上全球第一梯队 智东西
智东西 8 月 21 日报道,过去一个月,阿里巴巴模型发布全面提速,大语言、图像、语音、视频、音乐五大类模型密集完成重要版本迭代,性能均跻身国际第一梯队。
业内人士评价,多模态是下一代智能的范式。阿里在多模态领域的布局节奏远超市场预期。
模型密集迭代的背后,是模型能力与云基础设施增长的紧密联动。2027 财年第一季度(2026 年 4 月 1 日 -6 月 30 日),阿里云外部商业化收入增速提升至 45%,创 22 个季度新高。其中,AI 云及算力服务收入达 484.37 亿元,经调整 EBITA 为 56.28 亿元,同比激增 133%;AI 相关产品收入 123.76 亿元,连续第 12 个季度保持三位数同比增长。
在 AI 进入价值兑现期的当下,多模态正从模型榜单上的“能力补齐”走向广泛的产业场景,成为观察阿里 AI 进展的重要线索。
01. 阿里 AI 不止语言模型,多模态全面开花
在大语言模型方面,8 月发布的 Qwen3.8-Max 总参数达 2.4 万亿,在 CodeArena 编程竞技场排名全球第三,在 Artificial Analysis Agentic 榜单登顶全球第一。Qwen3.8-27B 开源仅两天下载量即突破 100 万次。截至 8 月,阿里累计开源模型超 460 个,Qwen 系列全球下载总量突破 30 亿次。
芯片厂商和推理框架快速跟进。平头哥、英伟达、AMD 等国内外厂商实现 Day0 适配 Qwen3.8,vLLM、SGlang 等开源社区第一时间优化推理框架,Qwen 已成为全球 AI 产业链的基础设施之一。
若将时间线拉长至整个季度,更密集的变化发生在多模态领域:
视频生成:6 月 22 日发布 HappyHorse 1.1,升级动态表现力、主体一致性及音频能力。
图像生成:7 月 21 日发布 Qwen-Image-3.0,支持 4.5k Token 输入,可生成含公式、几何图形的知识图解及复杂 UI,支持 12 种语言及 20 多款字体原生渲染。8 月 5 日该模型登上 Arena.ai 文生图榜单国内第一。
语音交互:7 月连续发布实时语音识别 Fun-ASR-Realtime、实时对话 Qwen-Audio-3.0-Realtime 及闪速识别 Qwen-Audio-3.0-ASR-Flash。该系列在 Artificial Analysis 7 月语音榜单中均获全球第一。
文档与音乐:8 月 6 日 Wan3.0 公测,单次视频生成达 30 秒,并首次支持 doc、xls、ppt 等文档输入;8 月 17 日 AI 音乐模型 HappyShrimp 上线,实现作词、作曲、编曲到演唱的端到端整曲生成。
在前沿的世界模型方向,阿里推出 HappyOyster 1.0,可根据文本或图片生成可互动、可探索的数字世界。至此,涵盖语言、图像、语音、视频、音乐及世界模型的完整版图已然浮现。
模型能力的扩张直接体现在收入端。财报显示,本季度阿里 AI 相关产品 ARR 突破 495 亿元,包括 MaaS 在内的模型与应用服务收入(ARR)突破 160 亿元。模型正从技术投入转变为规模化收入来源。
02. 从榜单到场景,多模态走进产业一线
大语言模型的商业化路径日益清晰。Anthropic 凭借 Coding 能力打开企业市场,而 Qwen3.8 在编程和专业办公能力上的提升,正沿着类似路径获得市场认可。
值得注意的是,多模态已跨过“炫技”阶段,开始进入一线商业化场景:
语音模型重塑人机交互入口
Qwen-Audio 正进入会议纪要、智能客服、车载助手、教育等高频率场景。相比单纯聊天,这些场景具备明确的调用频次、付费主体和 ROI。Fun-ASR-Realtime 支持 16 种方言和 30 种语言,首字延迟达百毫秒级,具备大规模商用条件。
图文视频模型赋能内容生产
Qwen-Image-3.0 聚焦复杂 UI 设计、多语言海报及知识图解;Wan 3.0 覆盖广告创意、影视制作及电商素材生产;HappyShrimp 则切入音乐创作市场。
据科技媒体 Semafor 报道,Pinterest 的 AI 购物助手采用了阿里 Qwen 大模型。Pinterest CEO 表示,使用开源模型成本不足同类闭源模型的 8%,直言不用开源模型即是浪费股东资金。
AI 对阿里核心业务的反哺也在加速。千问 App 深度集成淘宝生态,上线以来已有 2.5 亿用户通过其智能体功能实现 AI 驱动的购物体验,技术能力正转化为真实商业场景。
03. 能力补齐,多模态价值显现
AI 进入产业后,客户需求天然呈现多模态特征。布局多模态模型有助于阿里覆盖更多需求,消耗更多云资源,带动配套服务增长。
拓展新客户与新需求
多一个模态往往意味着一类新需求。例如汽车公司既需语言模型理解指令,也需实时语音交互;影视游戏行业则横跨文字、图片、声音和视频。
拉动重计算与全链条服务
高清图片、长视频等业务对 GPU、存储和网络提出更高要求,直接带动通用云资源增长。同时,多模态应用将需求链条延伸至数据处理、模型微调、数据库及安全等环节,从单次调用升级为整条 AI 生产链,提升客户黏性与客单价。
组织层面:今年 3 月成立 Alibaba Token Hub 事业群,由吴泳铭负责,以“创造、输送、应用 Token"为核心整合 AI 业务。
芯片层面:自研真武 AI 芯片已进入 20 多个行业、服务超 650 家外部客户。阿里正大规模部署自研倚天/真武体系芯片,逐步替换外购商业芯片以提升毛利率。
基础设施层面,阿里云持续扩张全球布局,完工后将覆盖 30 个地域、104 个可用区。新一代 CUBE 5.0 架构将大型 AIDC 交付周期压缩至 100 天,建设成本降低约 10%,今年计划将模块化数据中心全球产能提升两倍以上。
04. 结语:AI 进入兑现期,多模态价值被重估
过去两年,Qwen 纯文本模型是外界观察阿里 AI 的主要窗口,但这仅是冰山一角。在大众视线之外,阿里的图像、语音、视频、音乐等多模态模型正密集迭代,AI 版图已从单一语言模型扩展为完整的多模态智能体系。
随着 AI 从聊天走向内容生产、办公、电商及真实世界交互,多模态的重要性将持续上升。对阿里而言,这既是模型能力的补齐,也是深入产业深水区的新主线。曾被低估的多模态,正走到台前。
关注
在线咨询