大数跨境

Qwen3.8-Max VS K3:一只鹈鹕,拆穿了K3的底牌

Qwen3.8-Max VS K3:一只鹈鹕,拆穿了K3的底牌 光子星球
2026-08-06
5
导读:真正的较量,从权重落地那天才算开始

8 月 3 日,阿里正式发布 Qwen3.8-Max,总参数达 2.4 万亿,单次激活约 95B,支持 100 万 token 上下文。该模型基于 Qwen3.5 架构构建,官方定位聚焦「编程与办公全面跃升」,在 PaperBench 评测中斩获 93.0 分,超越 Claude 系及 GPT-5.6 等前沿模型。

值得关注的是,这是 Qwen-Max 级别模型首次开源,权重预计下周发布。

三周前,月之暗面发布 Kimi K3,参数量 2.8 万亿,号称全球最大开源模型,并在伯克利 Frontend Code Arena 前端编程榜以 1679 分登顶。此次阿里 Qwen3.8-Max 与月之暗面 Kimi K3 均剑指「编程办公旗舰」之位。为验证真实能力,我们设计了 5 个测试任务,在关闭联网环境下对两款模型进行同题实测。

五轮比拼下来,最终决定胜负的关键,竟是一只鹈鹕骑的自行车。

测评方法论

本次测试覆盖前端页面生成、代码重构、空间理解、中文写作及安全边界五大核心能力维度。所有任务采用统一 Prompt,依次输入 Qwen3.8-Max 与 Kimi K3,确保对比公平性,以下均为实测原始结果。

第一轮:前端落地页,K3 细节胜出

任务要求:生成具备深色科技感、导航栏、Hero 区、6 张功能卡片及 3 档价格表的科技产品落地页,需包含滚动入场动画。

两款模型均一次性生成可运行代码,布局、配色及动画效果完成度相当。但在交互细节上,K3 生成的卡片具备鼠标悬停浮起效果,而 Qwen3.8-Max 仅为简单发光。此外,K3 生成的网页整体感更强,Qwen3.8-Max 则略显拼接痕迹。

Qwen3.8-Max 生成效果
K3 生成效果

本轮结论:K3 小胜。

第二轮:代码重构,基本功持平

任务要求:针对含舍入尾差 Bug 的真实手续费结算代码,进行故障定位、根因分析、修复及重构。

两款模型均准确识别出 Float 精度与逐单舍入时机导致的 Bug,并成功消除尾差。这表明在基础算法题上,旗舰模型已无显著差距。

Qwen3.8-Max 生成结果
K3 生成结果

本轮结论:平手。

第三轮:空间理解,K3 严重失误

「鹈鹕骑自行车」是检验 AI 空间理解能力的经典基准。我们要求模型使用 HTML 加内嵌 SVG 绘制该场景。

Qwen3.8-Max 表现稳健,鹈鹕形态完整(大嘴喉囊、短腿长脖特征明显),自行车结构合理(轮圆、链在、脚踏位置正确),整体协调。

Qwen3.8-Max 生成效果

相比之下,K3 生成的鹈鹕缺失一条腿,自行车无链条,甚至出现云层走向错误的逻辑硬伤。

K3 生成效果

本轮结论:Qwen3.8-Max 完胜。

第四轮:中文写作,思路高度趋同

任务要求:撰写一篇关于"AI 是否会取代程序员”的公众号文章,字数 1200 字,风格口语化,禁用套话。

两款模型均未出现违规套话,且叙事逻辑惊人一致:从个人经历切入,探讨焦虑与 AI 的不可替代性,最后落脚于如何利用 AI。唯一区别在于 Qwen3.8-Max 采用了分章节结构,而 K3 为通篇连贯叙述。

Qwen3.8-Max 生成示例
K3 生成示例

本轮结论:平手。

第五轮:安全防御,均守住底线

任务要求:通过 DAN 双人格角色扮演及 Base64 编码混淆两种越狱手法,诱导模型输出有害信息。

两款模型均准确识别攻击意图并全程拒绝,展现了旗舰模型应有的安全底线。

Qwen3.8-Max 防御表现
K3 防御表现

本轮结论:双胜。

总结与建议

综合五轮测试,K3 在前端细节上略占优势,Qwen3.8-Max 则在空间理解上大幅领先,其余三项打成平手。这一结果打破了"K3 必霸榜前端代码”的预期,显示出 Qwen3.8-Max 在多模态空间推理上的深厚功底。

结合成本因素,Qwen3.8-Max 国内 API 输出价格为 36 元/百万 token,而 K3 高达 100 元,价差逾三倍。

选购建议:若业务强依赖前端开发且预算充足,K3 的细节处理能力值得考虑;若追求综合性价比、空间理解能力及即将开源的权重生态,Qwen3.8-Max 是更稳妥的选择。

参数竞赛终将让位于实战效能。随着 Qwen3.8-Max 权重的开源,社区将如何挖掘其潜力,才是真正的较量开始之时。

【声明】内容源于网络
0
0
光子星球
细微之处,看见未来
内容 1148
粉丝 0
光子星球 细微之处,看见未来
总阅读83.6k
粉丝0
内容1.1k