8 月 3 日,阿里正式发布 Qwen3.8-Max,总参数达 2.4 万亿,单次激活约 95B,支持 100 万 token 上下文。该模型基于 Qwen3.5 架构构建,官方定位聚焦「编程与办公全面跃升」,在 PaperBench 评测中斩获 93.0 分,超越 Claude 系及 GPT-5.6 等前沿模型。
值得关注的是,这是 Qwen-Max 级别模型首次开源,权重预计下周发布。
三周前,月之暗面发布 Kimi K3,参数量 2.8 万亿,号称全球最大开源模型,并在伯克利 Frontend Code Arena 前端编程榜以 1679 分登顶。此次阿里 Qwen3.8-Max 与月之暗面 Kimi K3 均剑指「编程办公旗舰」之位。为验证真实能力,我们设计了 5 个测试任务,在关闭联网环境下对两款模型进行同题实测。
五轮比拼下来,最终决定胜负的关键,竟是一只鹈鹕骑的自行车。
测评方法论
本次测试覆盖前端页面生成、代码重构、空间理解、中文写作及安全边界五大核心能力维度。所有任务采用统一 Prompt,依次输入 Qwen3.8-Max 与 Kimi K3,确保对比公平性,以下均为实测原始结果。
第一轮:前端落地页,K3 细节胜出
任务要求:生成具备深色科技感、导航栏、Hero 区、6 张功能卡片及 3 档价格表的科技产品落地页,需包含滚动入场动画。
两款模型均一次性生成可运行代码,布局、配色及动画效果完成度相当。但在交互细节上,K3 生成的卡片具备鼠标悬停浮起效果,而 Qwen3.8-Max 仅为简单发光。此外,K3 生成的网页整体感更强,Qwen3.8-Max 则略显拼接痕迹。
本轮结论:K3 小胜。
第二轮:代码重构,基本功持平
任务要求:针对含舍入尾差 Bug 的真实手续费结算代码,进行故障定位、根因分析、修复及重构。
两款模型均准确识别出 Float 精度与逐单舍入时机导致的 Bug,并成功消除尾差。这表明在基础算法题上,旗舰模型已无显著差距。
本轮结论:平手。
第三轮:空间理解,K3 严重失误
「鹈鹕骑自行车」是检验 AI 空间理解能力的经典基准。我们要求模型使用 HTML 加内嵌 SVG 绘制该场景。
Qwen3.8-Max 表现稳健,鹈鹕形态完整(大嘴喉囊、短腿长脖特征明显),自行车结构合理(轮圆、链在、脚踏位置正确),整体协调。
相比之下,K3 生成的鹈鹕缺失一条腿,自行车无链条,甚至出现云层走向错误的逻辑硬伤。
本轮结论:Qwen3.8-Max 完胜。
第四轮:中文写作,思路高度趋同
任务要求:撰写一篇关于"AI 是否会取代程序员”的公众号文章,字数 1200 字,风格口语化,禁用套话。
两款模型均未出现违规套话,且叙事逻辑惊人一致:从个人经历切入,探讨焦虑与 AI 的不可替代性,最后落脚于如何利用 AI。唯一区别在于 Qwen3.8-Max 采用了分章节结构,而 K3 为通篇连贯叙述。
本轮结论:平手。
第五轮:安全防御,均守住底线
任务要求:通过 DAN 双人格角色扮演及 Base64 编码混淆两种越狱手法,诱导模型输出有害信息。
两款模型均准确识别攻击意图并全程拒绝,展现了旗舰模型应有的安全底线。
本轮结论:双胜。
总结与建议
综合五轮测试,K3 在前端细节上略占优势,Qwen3.8-Max 则在空间理解上大幅领先,其余三项打成平手。这一结果打破了"K3 必霸榜前端代码”的预期,显示出 Qwen3.8-Max 在多模态空间推理上的深厚功底。
结合成本因素,Qwen3.8-Max 国内 API 输出价格为 36 元/百万 token,而 K3 高达 100 元,价差逾三倍。
选购建议:若业务强依赖前端开发且预算充足,K3 的细节处理能力值得考虑;若追求综合性价比、空间理解能力及即将开源的权重生态,Qwen3.8-Max 是更稳妥的选择。
参数竞赛终将让位于实战效能。随着 Qwen3.8-Max 权重的开源,社区将如何挖掘其潜力,才是真正的较量开始之时。

