大数跨境

市值暴涨1300亿!阿里最强千问大模型登场,2.4万亿参数,自主连续编程16天破纪录

市值暴涨1300亿!阿里最强千问大模型登场,2.4万亿参数,自主连续编程16天破纪录 智东西
2026-08-03
0
导读:连续自主编程16天,24小时击败458支人类队伍。

连续自主编程 16 天,24 小时击败 458 支人类队伍。
作者 |  江宇
编辑 |  云鹏
智东西 8 月 3 日报道,阿里正式发布旗舰大模型 Qwen3.8-Max,总参数量达 2.4 万亿,激活参数 950 亿。这是目前参数规模最大的千问模型,也是首个计划开放权重的 Max 级模型。
受此消息影响,阿里巴巴港股股价上涨 7.26%,市值达 2.41 万亿港元。

▲图源:腾讯微证券(截至 8 月 3 日 13 点)

Qwen3.8-Max 此次升级聚焦编程、办公、科研、长程任务和多模态智能体五大方向,相比上一代更强调端到端完成复杂任务的能力。
API 定价方面,国内每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中 1.5 元;海外分别为 2 美元、6 美元和 0.25 美元。

▲API 价格对比表(智东西制图)

发布当日,Qwen3.8-Max 在国际权威评测榜单 Arena 三个分项中表现优异:
  • 文本任务 Text Arena:以 1496 分位列实验室榜第二,单模型排名第五,仅次于 Anthropic;
  • 代码开发 CodeArena WebDev:以 1668 分位列实验室榜第三、单模型第四,排在 Claude Opus 5 Max 和 Kimi K3 Max 之后;
  • 视觉任务 Vision Arena:以 1305 分位列第二,略高于 Claude Opus 4.7 Thinking,仅落后于 Claude Fable 5。
在多项基准测试中,Qwen3.8-Max 已逼近 Claude Fable 5、GPT-5.6 Sol 和 Gemini 3.1 Pro 等最新旗舰模型。例如,在论文复现基准 PaperBench 中得分 93.0,超越 GPT-5.6 Sol 等竞品;在评估电脑操作能力的 OSWorld-Verified 中以 86.1 分位居首位;在参数化 CAD 基准中得分为 91.5,同样优于主要竞争对手。
不过,该模型尚未在所有测试中领先。在 TerminalBench 2.1 中略低于 GPT-5.6 Sol;在 SWE-bench Pro 中落后于 Fable 5 和 Claude Opus 4.8;在长视频基准 VideoMME v2 中也低于 GPT-5.6 Sol。
半个月前,Qwen3.8-Max 预览版已上线 Qoder 和阿里 Token Plan,团队曾称其“可能是除了 Fable 5 外最强大的模型”。如今正式版发布,核心验证点在于模型能否脱离人工持续陪伴,独立完成跨度数小时至数周的复杂任务。
为检验这一能力,千问团队让 Qwen3.8-Max 连续自主编程约 16 天、独立复现并改进研究论文、参加真实算法竞赛,并在超过 2000 轮交互中经营一家虚拟电商企业。
目前,Qwen3.8-Max 已上线千问 AI 平台,模型权重将于下周登陆 Hugging Face 和 ModelScope,供开发者下载部署。

实测:生成《奥德赛》3D 世界

为观察 Qwen3.8-Max 在长代码、3D 场景生成和视觉反馈方面的表现,测试要求其将《奥德赛》开篇转化为可交互的 Three.js 项目。模型一次生成版本即可运行,搭建出海岛、神殿、人物及基础镜头运动。
初版视觉效果相对简陋,建筑与人物多由基础几何体构成,场景联系较弱。经反馈优化后,第二版在植被、建筑结构、海面及光影层次上有所改善,但整体完成度仍有限。
与 Andrej Karpathy 使用 Claude Opus 5 生成的《指环王》3D 世界相比,Qwen3.8-Max 在场景编排、模型细节和沉浸感上仍有差距。

连续自主编程 16 天构建自进化 Harness

长程编程与自我迭代

长程编程是此次升级重点。在案例中,Qwen3.8-Max 从零创建名为 oh-my-cli 的项目,并搭建能持续自我更新的 Agent 开发系统。模型需处理多方反馈,自动整理 GitHub Issue、领取任务、修改代码、运行测试并提交 PR。
该系统包含完整任务状态机,代码完成后自动触发构建与各类测试。截至 7 月 30 日,项目在无人持续介入下运行约 16 天,累计产生 265 次代码提交、127 个 PR 和 151 个 Issue。
此类案例考察模型管理持续变化工程项目的能力,包括保留任务状态、吸收新反馈及判断代码合并时机。

论文复现与算法竞赛

在无初始代码情况下,模型连续工作约 125 小时,编写 7600 行代码,执行超 1100 步操作,完成 33 轮 GPU 训练,成功复现论文《Unified Data Selection for LLM Reasoning》。前 37 小时复现六项主要结论,随后 88 小时提出 18 种改进方案,最终在 AIME 2024 上提升 2.7 分。
在阿里云天池 WWW 2025 多模态对话意图识别挑战赛中,Qwen3.8-Max 与 526 支人类队伍竞争。它在 24 小时内自行搭建文本与视觉模型及加权投票系统,经过 45 次提交,准确率由 0.60 提升至 0.853,击败 458 支人类队伍,胜率超 87%。

调度约 330 个子 Agent 完成 6000 次回测

通用办公与专业任务

在通用办公和专业任务方面,Qwen3.8-Max 开始承担更完整的工作流。千问团队扩展了用于强化学习的真实任务环境,覆盖多种 Agent 框架,并加入多文件目录、复杂工作区及跨天执行等场景。

▲随着 RL 训练持续 scale up,Qwen3.8-Max 在数十个 in-house / public 工作基准上取得的性能提升。

▲Qwen3.8-Max 在 QwenWork、Claude Code、Codex、OpenClaw、Hermes 等众多 harness 取得的性能表现。

在法律、设计、餐饮、建筑、医疗和体育分析等职业任务中,模型表现出色:一小时内标记 1284 条合规条款;生成含 8 个页面的可交互数字银行 App 原型;结合上百份食材资料生成菜单并将成本率控制在 33.8%;还原 30 层写字楼抗震结构模型;处理球员攻防数据并生成分析报告。

大规模子 Agent 调度

在量化研究案例中,模型根据六条因子描述拆解出 50 个研究方向,调度约 330 个子 Agent 完成约 6000 次回测,并根据阶段性结果调整搜索方向。最终入选因子的超额夏普比率介于 0.64 至 1.48 之间。
在 ETF 轮动策略任务中,模型能主动删除冗余因子或加入不同随机种子验证,展现出较强的自我修正能力。

500 轮迭代重写芯片设计门数压至 678 个

除软件工程外,Qwen3.8-Max 还被用于数字芯片设计。测试要求设计一款 GCD/RSA 硬件加速器,在保证功能验证通过前提下,尽可能减少逻辑门数量。
模型在沙箱环境中自行完成算法设计、代码编写、仿真、综合和物理布局。经历约 500 轮交互和 71 次正式评估后,逻辑门数量从初始的 8298 个优化至 678 个。其中第 22 轮交互通过将取模除法器替换为迭代移位减法架构,一次性减少 6288 个门。
物理实现环节,芯片面积缩小 81%,布线长度大幅降低,并在 500MHz 下实现时序闭合。模型在数百轮交互后仍能进行算法和结构层面的修改,体现出维持长期工程状态的能力。
在模拟 365 天电商经营的 E-Commerce Bench 测试中,面对欺诈商家、大促及供应链中断等随机事件,Qwen3.8-Max 在超过 2000 轮交互后,将 10 万元启动资金增值至 41.6 万元,成绩比第二名 GLM 5.2 高 38%,相比 Qwen3.7-Max 提高 152%。

支持百小时视频处理与电脑操作复刻

多模态能力升级

Qwen3.8-Max 强化了多模态能力,可处理超 200 页财报及复杂 PDF,跨页面提取信息并生成结构化报告。针对长视频,模型能处理超 100 小时素材,构建视频记忆以追踪人物关系和事件变化。
在输出端,模型可根据截图编写前端项目,将户型图转化为 Blender 3D 装修效果,或剪辑 Vlog 和教学动画。这种编程与图形界面操作结合的方式被称为"Hybrid Agent"。

▲多模态效果

电脑操作与应用复刻

在 RecreationBench 内部基准中,模型需通过观察运行中的应用来复刻各平台软件,取得 51.7 分,高于 Claude Opus 4.8 和 GPT-5.6 Sol。在公开基准 OSWorld-Verified 中,Qwen3.8-Max 以 86.1 分超越 Fable 5 等竞品;在 MobileWorld 中得分为 77.8,略高于 GPT-5.6 Sol。
为使现有 Agent 框架获得多模态能力,千问推出了 Qwen-MM-Plugins,提供图像视频处理、多模态记忆及专业工具支持。

结语:旗舰开源竞争转向长程交付

Qwen3.8-Max 的升级方向明确:参数规模继续扩大,能力更多围绕复杂任务的实际交付展开。连续运行 16 天维护代码、125 小时复现论文、调度 330 个子 Agent 完成 6000 次回测等案例,反映出模型正尝试在较少人工干预下持续处理开放任务。
测试显示,Qwen3.8-Max 在论文复现、电脑操作、CAD 及部分多模态任务中已达前沿水平,但在 SWE-bench Pro、TerminalBench 2.1 和部分长视频测试中与最新闭源模型仍有差距。
下周开放权重后,开发者将进一步检验其真实能力,包括 2.4 万亿参数模型的部署成本、Agent 长时间运行的稳定性,以及内部案例在外部环境中的复现情况。
【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11763
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读200.0k
粉丝0
内容11.8k