
智东西 8 月 13 日报道,阿里千问大模型团队正式开放 Qwen3.8-2.4T-A95B 模型权重。这是阿里首次将 Max 级别的旗舰模型对外开源。
模型参数与核心特性
Qwen3.8-Max 是基于 Qwen3.8-2.4T-A95B 的官方版本,于 8 月 3 日发布。该模型总参数达 2.4 万亿,每个 Token 激活 950 亿参数,原生支持 262144 Token 上下文,可扩展至 101 万 Token。其采用 Qwen3.5 底层架构,在编程、办公、科研及长周期智能体任务上性能显著提升。
相比开源版,Qwen3.8-Max 拥有更多功能,包括视觉输入、无需思考即可直接使用、默认支持百万级上下文处理及内置官方工具等。值得注意的是,Qwen3.8-2.4T-A95B 不支持关闭思考模式,运行时会先生成由<think>标记的思考内容。
▲Qwen3.8-2.4T-A95B 开源主页(图源:Hugging Face)
目前,魔搭社区与 Hugging Face 已上线模型下载。根据官方预告,更小参数的 Qwen3.8-27B 版本也将 soon 发布。
魔搭社区模型下载地址:
https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B
https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
部署方案与体积压缩
该模型可通过 SGLang、vLLM 和 TokenSpeed 推理引擎部署。正式部署时需使用各框架针对 Qwen3.8 的最新 Recipe,并依据权重精度、GPU 型号与数量选择并行策略。
针对庞大的模型体积,开源 AI 项目团队 Unsloth AI 利用动态 1-bit 分层选择性量化技术,将原始 4.9TB 的模型压缩至 397GB,存储空间缩减 91%。借助 Unsloth-Desktop 工具,设备内存与显存总量达到 410GB 以上即可实现本地运行。
▲Unsloth AI 压缩 Qwen3.8-2.4T-A95B(图源:X)
基准测试表现
千问团队曾宣称该模型“可能是除了 Fable 5 外最强大的模型”。基准测试显示,在论文复现基准 PaperBench 中,Qwen3.8-Max 得分 93.0,高于 GPT-5.6 Sol、Fable 5 和 Claude Opus 4.8;在评估电脑操作能力的 OSWorld-Verified 中,以 86.1 分位居首位;在参数化 CAD 基准中,以 91.5 分超越 Fable 5、GPT-5.6 Sol 和 Gemini 3.1 Pro。
然而,Qwen3.8-Max 并非在所有测试中均领先。在 TerminalBench 2.1 中,其得分为 86.6,略低于 GPT-5.6 Sol 的 88.8 分;在 SWE-bench Pro 中获 67.7 分,落后于 Fable 5(80.0 分)和 Claude Opus 4.8(69.2 分);在长视频基准 VideoMME v2 中,得分为 68.3,亦低于 GPT-5.6 Sol 的 71.1 分。
▲Qwen3.8-Max 基准测试结果(图源:阿里)
长周期智能体能力验证
Qwen3.8 的核心突破在于脱离人工持续陪伴,独立完成跨度数小时至数周的复杂任务。千问团队进行了多项实测:让模型连续自主编程约 16 天、独立复现并改进研究论文、参加真实算法竞赛,以及在超过 2000 轮交互中经营一家虚拟电商企业。
在连续自主编程任务中,Qwen3.8-Max 成功构建自进化 Harness,持续完成社区需求收集、issue 派发、代码生成、验证与自我修复闭环。
▲Qwen3.8-Max 执行自主编程任务(图源:阿里)
API 定价策略
API 价格方面,Qwen3.8-Max 国内标准为:每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中 1.5 元;海外标准为:每百万 Tokens 输入 2 美元、输出 6 美元,隐式缓存命中 0.25 美元。
▲API 价格对比表(智东西制图)
结语:全球顶流模型齐聚,聚焦智能体能力
近期,全球三大顶流大模型轮番更新:马斯克推出 Grok 4.6,其 high 版本在多项智能体基准测试中与 GPT-5.6 Sol Max、Claude Fable 5 Max 相当;DeepSeek-V4-Pro 正式版上线,综合性能接近并在部分指标上超越 Claude Fable 5;此次阿里 Qwen3.8 开放权重,标志着中国开源大模型布局的关键落子。
可以看出,头部厂商竞争焦点已转向多步骤、长周期的自主工作能力,比拼模型独立承接完整项目、实现自主闭环的智能体水平。
9 月 20-21 日,智东西主办的 2026 全球 AI 芯片峰会将在上海举行。大会设有开幕式,以及大模型 AI 芯片、Agent 推理芯片、具身智能芯片 3 场高峰论坛,同时举办 Token 工厂异构混训混推、超节点、AI 芯片架构创新、新型存储器、大模型 KV Cache 5 场技术研讨会。

