文本任务 Text Arena:以 1496 分位列实验室榜第二,单模型排名第五,仅次于 Anthropic;
代码开发 CodeArena WebDev:以 1668 分位列实验室榜第三、单模型第四,排在 Claude Opus 5 Max 和 Kimi K3 Max 之后;
视觉任务 Vision Arena:以 1305 分位列第二,略高于 Claude Opus 4.7 Thinking,仅落后于 Claude Fable 5。
在多项基准测试中,Qwen3.8-Max 已逼近 Claude Fable 5、GPT-5.6 Sol 和 Gemini 3.1 Pro 等最新旗舰模型。例如,在论文复现基准 PaperBench 中得分 93.0,超越 GPT-5.6 Sol 等竞品;在评估电脑操作能力的 OSWorld-Verified 中以 86.1 分位居首位;在参数化 CAD 基准中得分为 91.5,同样优于主要竞争对手。不过,该模型尚未在所有测试中领先。在 TerminalBench 2.1 中略低于 GPT-5.6 Sol;在 SWE-bench Pro 中落后于 Fable 5 和 Claude Opus 4.8;在长视频基准 VideoMME v2 中也低于 GPT-5.6 Sol。半个月前,Qwen3.8-Max 预览版已上线 Qoder 和阿里 Token Plan,团队曾称其“可能是除了 Fable 5 外最强大的模型”。如今正式版发布,核心验证点在于模型能否脱离人工持续陪伴,独立完成跨度数小时至数周的复杂任务。为检验这一能力,千问团队让 Qwen3.8-Max 连续自主编程约 16 天、独立复现并改进研究论文、参加真实算法竞赛,并在超过 2000 轮交互中经营一家虚拟电商企业。目前,Qwen3.8-Max 已上线千问 AI 平台,模型权重将于下周登陆 Hugging Face 和 ModelScope,供开发者下载部署。
实测:生成《奥德赛》3D 世界
为观察 Qwen3.8-Max 在长代码、3D 场景生成和视觉反馈方面的表现,测试要求其将《奥德赛》开篇转化为可交互的 Three.js 项目。模型一次生成版本即可运行,搭建出海岛、神殿、人物及基础镜头运动。初版视觉效果相对简陋,建筑与人物多由基础几何体构成,场景联系较弱。经反馈优化后,第二版在植被、建筑结构、海面及光影层次上有所改善,但整体完成度仍有限。与 Andrej Karpathy 使用 Claude Opus 5 生成的《指环王》3D 世界相比,Qwen3.8-Max 在场景编排、模型细节和沉浸感上仍有差距。