阿里巴巴近日正式发布新一代基座大模型 Qwen3.8-Max。该模型参数量达 2.4 万亿,在编程、专业工作、长程任务及多模态智能体等场景表现卓越,成功跻身全球大模型第一梯队,性能直逼 Anthropic 的 Claude 系列。
△Text Arena 文本能力榜单,涵盖数学、代码及创意写作等领域
在编程能力方面,Qwen3.8-Max 表现尤为突出,甚至在部分测试中超越了 Claude Opus 5 及 Fable 5 的高阶版本。
△前端编程能力榜单,重点考察多步骤推理及工具调用能力
除性能强劲外,Qwen3.8-Max 在定价上也极具竞争力。国内价格为每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中仅需 1.5 元;国际价格仅为竞品 Opus 5 的 40%(输入)与 24%(输出),实现了高性能与低成本的平衡。
首批用户体验反馈显示,该模型在复杂任务交付上表现出色。有开发者利用其复刻了《愤怒的小鸟》游戏,成本消耗极低;亦有用户通过单条提示词构建了完整的可交互作品集,展现了强大的工程落地能力。
社区讨论热烈,不少用户认为 Qwen3.8-Max 的基准测试表现已超越部分闭源模型,改变了市场对高端模型“昂贵且封闭”的固有印象。
核心能力实测:编程、长程任务与多模态分析
实测表明,Qwen3.8-Max 在处理真实世界复杂问题时,具备从拆解、执行到最终交付的全流程能力。其在科研复现、多模态理解、长视频分析及电脑操作等多项指标上超越 GPT-5.6、Opus 4.8 与 Fable 5,稳居行业头部。
Qwen3.8-Max 的核心亮点总结如下:
- 编程能力:支持复杂任务的端到端自主交付,涵盖需求理解、工程搭建、实验运行及结果优化。官方案例显示,其可在无人干预下自主推进十多天,交付完整可用项目。
- 长线程任务:具备系统级自主规划与执行能力,在数千轮超长程交互中保持目标不迷失。
- 专业工作:能一次性交付需多次返修的 APP 原型,或在一小时内处理数百份法律文档并完成上千个条款标注。
- 多模态智能体:可消化数百页复杂材料及上百小时视频内容,并整理为直接可用的成果。
编程能力深度测评:从零构建全链路项目
为验证其 AI Coding 能力,测试者模拟产品经理角色,提供了一整页详细的产品需求文档,要求模型从零开发一个可运行的 AI 资讯网页。需求涵盖核心功能、数据约束、技术选型及验收标准。
约 5 分钟后,模型交付了接近正式产品水准的全链路成果。整个过程包含需求拆解、技术选型、项目结构搭建及功能实现,并附带详细的“问题与解决记录”,展示了其自主排查和修复错误的能力。
更令人意外的是,模型在交付前自动执行了完整的“功能验收”,涵盖依赖安装、本地启动、生产构建及预览,并对数据量、分类覆盖及页面恢复等细节进行了逐项测试,最终全部通过。实测结果显示,生成的网页功能完整、交互流畅,完全符合需求文档预期。
长文本交叉分析:精准定位跨章节信息
针对长文档处理难点,测试者输入了一篇由 AI 专家卡帕西参与撰写的几十页论文,要求模型结合正文、图表及附录,对比分析 ILSVRC 与 PASCAL VOC 两套数据集的难度差异。
问题:结合正文、表 3 和附录 B 的图 16,对比 ILSVRC 和 PASCAL VOC,哪套题更难?为何看平均值与看困难类别会得出不同结论?
该问题要求模型跨越数十页文档,对分散在文字、表格和图片中的数据进行交叉分析。Qwen3.8-Max 在 33 秒内给出准确结论:整体平均值上 PASCAL VOC 看似更难,但在可比类别及困难子集上,ILSVRC 难度相当甚至更高。
结论:只看整体平均值,PASCAL VOC 似乎更难;但看可比类别和 ILSVRC 的困难子集,ILSVRC 在很多方面并不比 PASCAL VOC 简单,甚至更难。

经人工核对原文图表,模型的分析完全正确。此外,模型还生成了一份详尽的分析报告,从物体大小、位置变化、定位难度等维度进行论证,并直接引用原文表格作为证据,展现了极强的逻辑推理与信息整合能力。
多模态长视频理解:精准定位观点与时间轴
在多模态场景下,测试者输入了一期近 70 分钟的播客视频(山姆·奥特曼访谈),要求模型生成完整的主题时间轴,并按话题观点定位原始片段。
△播客来源:「Relentless」Youtube 账号
任务:为这期播客生成完整的主题时间轴,并按「话题观点」定位原始片段。
模型在两三分钟内完成了任务,输出了按核心观点划分的内容摘要。每个话题均采用“先总结、再展开”的结构,并精确标注了对应的时间戳,极大地提升了长视频内容的检索效率。
总结:高性能与低成本的完美平衡
当前大模型市场往往难以兼顾能力、场景覆盖与价格。Qwen3.8-Max 的出现打破了这一僵局,以远低于竞品的价格提供了顶级的性能体验。其输入输出价格仅为 Opus 5 的 40% 与 24%,让用户无需承担高昂成本即可享受高性能模型带来的完整工程交付能力。
△AI 生成
依托阿里庞大的开源生态,Qwen 家族已累计开源 400 多个模型,衍生模型超 20 万个,下载量突破 10 亿次。从基础推理到端到端交付,Qwen3.8-Max 标志着国产大模型在实用性与性价比上达到了新的高度。
目前,Qwen3.8 系列 API 已上线千问 AI 平台,并接入全新 Agent 产品“千问办公”,供广大开发者与企业用户直接使用。
相关平台链接:
[1] 千问 AI 平台:https://www.qianwenai.com/
[2] QwenStudio 平台:https://chat.qwen.ai/
[3] 千问办公平台:https://qwenwork.cn/

