
干翻自家 Qwen3.7-Plus,阿里开源 27B 原生多模态模型
智东西 8 月 14 日报道,阿里千问正式开源Qwen3.8-27B模型权重。这是一款参数为 270 亿的原生多模态稠密模型(Dense),支持图像与视频理解,原生上下文长度达 262K,并可通过 YaRN 技术扩展至 100 万 Tokens。
相比超大规模 MoE 模型,27B 的 Dense 架构部署门槛显著降低,量化后家用级显卡即可运行,极适合本地部署及轻量化应用开发。该模型基于 Apache 2.0 协议开放,开发者、科研机构及企业均可免费下载、部署并商用。
▲Qwen3.8-27B 开源主页(图源:Hugging Face)
作为 Qwen3.8 系列的最新成员,此次发布的 27B 版本将此前 Max 级别底座(Qwen3.8-2.4T-A95B)的 Agent、多模态及长上下文能力压缩至更小的参数规模中,进一步聚焦于本地化与轻量化场景。
测试数据显示,Qwen3.8-27B 在编程、长周期办公、Computer Use等任务上较上一代 Qwen3.6-27B 提升明显,多项成绩超越参数更大的 Qwen3.7-Plus;在 SWE-bench Pro、OSWorld-Verified 等基准测试中,其表现甚至超过了Claude Opus 4.6 Max。
模型开源后迅速引发海外开发者关注。有观点认为,在仅 270 亿参数的情况下 achieves 如此表现“令人印象深刻”。一位知名 AI 博主将其称为“显著跃升”,指出前沿大模型的 Agent 能力正加速向低成本、可自部署的开源模型下沉。同时他也提醒,目前数据主要来自官方测试,尚待第三方独立验证。
千问方面透露,Qwen3.8-27B 后续将上线官方 API 版本,默认提供 100 万 Tokens 上下文及内置工具等生产级功能。截至目前,千问累计开源模型已超 460 个,Qwen 系列全球下载量突破 30 亿次,衍生模型数量超 30 万个。
01. 270 亿参数集成多模态与 Agent 能力,原生上下文达 262K
Qwen3.8-27B 延续 Qwen3.8 技术路线,是一款搭载视觉编码器的原生多模态 Dense 模型。其参数量为 270 亿,包含 64 层网络,隐藏维度 5120,采用 Gated DeltaNet 与 Gated Attention 混合结构,并具备多步 Multi-Token Prediction(MTP)能力。
相比传统文本模型,Qwen3.8-27B原生支持图像和视频理解,可处理 STEM 图表、文档、真实世界图像及小时级长视频。上下文方面,模型原生支持 262,144 Tokens,通过 YaRN 技术可扩展至100 万 Tokens,能够覆盖长文档分析、多模态理解及长周期 Agent 任务。
在 Agent 执行能力上,模型强化了自主规划、环境反馈处理及复杂任务的端到端执行。Qwen3.8-27B 默认开启思考模式,新增 reasoning_effort 功能以调节推理深度;开发者亦可关闭该模式或通过 preserve_thinking 保留推理上下文,实现效果与成本的精细控制。
部署生态方面,该模型已兼容 Hugging Face Transformers、vLLM、SGLang、TokenSpeed 等主流框架。
02. 编程与办公能力大幅跃升,部分基准超越 Claude Opus 4.6 Max
Qwen3.8-27B 最突出的变化在于,其 270 亿参数模型的 Agent 能力已逼近更大规模模型。在 SWE-bench Pro 测试中,该模型取得61.7 分,不仅高于 Qwen3.6-27B(53.5 分)和 Qwen3.7-Plus(57.6 分),更超越了 Claude Opus 4.6 Max 的 53.4 分。
在千问自建评测体系中,Qwen3.8-27B 同样优势明显:
- 软件工程基准 QwenSWEBench:得分79.0,远超 Qwen3.7-Plus(59.2 分)与 Claude Opus 4.6 Max(63.8 分)。
- 长周期办公任务 CoWorkBench:得分70.7,超过 Qwen3.7-Plus(65.1 分)及 Claude Opus 4.6 Max(68.2 分)。
在 Computer Use 领域,提升同样显著:
- OSWorld-Verified 测试:得分84.3,大幅领先 Qwen3.7-Plus(73.3 分)和 Claude Opus 4.6 Max(72.7 分)。
- AndroidWorld 手机操作测试:得分81.9,优于 Qwen3.7-Plus(81.0 分)及 Claude Opus 4.6 Max(62.0 分)。
此外,在多模态软件工程 SWE-MM 测试中,Qwen3.8-27B 获 38.6 分,高于 Qwen3.7-Plus(30.0 分)和 Claude Opus 4.6 Max(27.1 分);在竞技编程基准 LiveCodeBench v6 上拿到 90.3 分,亦胜过 Claude Opus 4.6 Max 的 88.8 分。
当然,Qwen3.8-27B 并非全面领先。在 Terminal Bench 2.1、GPQA Diamond 及 HLE 等高难综合推理测试中,其成绩仍略低于 Claude Opus 4.6 Max。总体而言,该模型在软件工程、Computer Use、长周期办公等 Agent 任务上已媲美甚至超越部分前沿闭源模型,但在科学推理等领域仍有追赶空间。
作为开源社区关注的热门尺寸,Qwen3.8-27B 采用 Dense 架构,大幅降低了部署门槛。千问将其定位为面向开发者的高效率模型,旨在覆盖本地应用及对成本、灵活性要求更高的 Agent 场景。
03. 结语:270 亿参数模型掀起 Agent 能力下沉浪潮
Qwen3.8-27B 的核心价值在于将 Agent 能力下沉至更易部署的参数规模。它在 270 亿参数下集成了原生多模态、262K 长上下文、可控推理及多种 Agent 任务能力,并在部分关键测试中追平或超越更大规模的闭源模型。
继 Qwen3.8-2.4T-A95B 将 Max 级能力带入开源后,27B 版本的推出补齐了实际部署的关键一环。未来值得关注的是,这款模型在本地环境中能否稳定跑出低成本、高可用的实际应用。
9 月 20-21 日,智东西主办的2026 全球 AI 芯片峰会将在上海举行。会议设有开幕式,以及大模型 AI 芯片、Agent 推理芯片、具身智能芯片 3 场高峰论坛,涵盖 Token 工厂异构混训混推、超节点、AI 芯片架构创新、新型存储器、大模型 KV Cache 等 5 场技术研讨会。