大数跨境

我们用 Qwen 3.8-Max 做了一个 AI 大模型宇宙:效果竟然胜过 GPT5.6?

我们用 Qwen 3.8-Max 做了一个 AI 大模型宇宙:效果竟然胜过 GPT5.6? AI科技评论
2026-08-09
5
导读:Max长程Agent能力的背后,是精雕细琢的典范,还是算力黑洞的失控?
Max 长程 Agent 能力:精雕细琢的典范,还是算力黑洞的失控?

作者丨李娜

编辑丨岑峰

实测显示,Qwen 3.8-Max 在从零搭建 3D 大模型演进网站及与 GPT-5.6 的迭代对比中表现独特。

(Qwen3.8-Max 运行成果截图)

效果上限:Qwen 3.8-Max 展现了远超 GPT-5.6 的交付细节与完成度;

效率成本:高完成度背后是低效,因无法自主判断任务终点导致额度耗尽中断;

适用场景:追求快速迭代与低成本原型,GPT 仍是首选;在不计成本追求极致性能的场景,Qwen 3.8-Max 提供了昂贵但有效的国产替代方案。

2.4 万亿参数之后,Max3.8 为何强调 Agent?

8 月 3 日,阿里正式发布 Qwen 3.8-Max。其规格依然醒目:2.4 万亿总参数、约 950 亿激活参数、100 万 Token 上下文,覆盖文本、代码和视觉任务,并计划开放 Max 权重和 27B 小模型。榜单、规模、价格和开源策略,延续了 Qwen 过去的竞争路线。

(阿里 Qwen3.8 max 官方技术博客截图)

然而,仅靠参数规模已难解释 Max 的差异化。相比 Kimi K3 的架构叙事,Qwen3.8-Max 未公布同等分量的新基础架构;其价格虽有竞争力,但不足以单独改变模型选择;2.4T 权重的开放主要面向云厂商与研究机构。当头部模型基础能力普遍趋同,“更大、更强、更开放”难以成为旗舰模型的独有理由。

Qwen3.8-Max 此次将重心转向长程 Agent。技术博客中,模型规格一笔带过,重点展示了 16 天自主开发、125 小时科研复现及数百轮芯片优化等端到端执行项目。其核心在于验证模型在真实环境中调用工具、接收反馈、检查结果并持续修正复杂任务的能力。

这确立了 Max 的新定位:不再承担普及和本地部署任务,而是负责抬高 Qwen 体系的能力上限,再通过 Qwen Code、办公 Agent 和阿里云将这种能力注入具体工作流。

Agent 能力源自何处?Max 聚焦真实环境 RL

Qwen3.8-Max 基于 Qwen 3.5 架构构建,其 Agent 能力的提升主要归功于真实环境中的RL(强化学习训练)

(阿里 Qwen3.8 max 官方技术博客截图:RL 训练环境数量与能力增长曲线)

所谓“真实环境 RL",是将模型置于接近实际工作的环境中:读取项目、调用工具、执行代码、观察页面、接收测试反馈并据此修改。训练目标从生成标准答案转变为学会完整的工作闭环:规划任务、采取行动、检查结果、发现问题并决定下一步。

这是 Agent 能力与普通生成能力的关键区别:Agent 必须理解当前状态,选择工具,并根据外部反馈动态调整策略。

(图:Qwen3.8-Max 扩展真实环境强化学习系统的三项关键机制)

为扩大此能力,Qwen3.8-Max 实施了三项训练工程:

  • 环境解耦:将任务、工作空间和 Agent Harness 拆分为三个可独立扩展的维度。
  • 统一奖励系统:将代码执行、文本合规、视觉结果及 Agent 行为合理性纳入同一套评价机制。

(图:Qwen3.8-Max 在不同 Agent Harness 中的官方测试表现)

  • 在线数据均衡:动态配平不同任务类型、难度及工作空间中的数据,避免模型仅在少数场景表现出长程能力。

(Qwen3.8-Max 被要求从零创建 oh-my-cli 项目,并在十天级长程自动编程中构建自进化 harness)

因此,Qwen3.8-Max 真正强化的是模型在外部反馈中持续行动的能力。官方展示的长周期项目均依赖“行动 - 反馈 - 再执行”的机制。这也解释了为何“长程”不能仅用时间衡量:真正的价值在于反馈循环能否推动项目完成,而非单纯延长工作时间。

若 Max 的 Agent 能力确源于此,其在复杂项目中应表现出更强的持续推进与自我修正能力,但同时也可能伴随更长的耗时、更高的 Token 消耗及更难判断结束时机的问题。

测试一:从零生成 3D 大模型演进宇宙星图

为验证长程 Agent 能力,通过 Qwen Code 将模型接入真实本地开发环境,要求其从零生成一个可交互的 3D 大模型演进网站。技术要求包括使用 React、Vite 和 Three.js,将不同模型公司设计为星系,历代模型设计为星球,支持旋转缩放、点击查看档案、时间轴演化及搜索功能,且必须是真正的 WebGL 三维场景。

最终项目成功搭建了 WebGL 三维场景,涵盖六大星系、28 个模型节点,实现了旋转缩放、检索、聚焦、档案展示和时间轴筛选等功能。更重要的是,各功能间存在逻辑依赖:切换时间轴时场景模型数量实时变化,选中模型被排除时档案面板同步关闭,显示出模型对状态依赖关系的理解。

存在的问题主要集中在视觉精修与工程细节:

  • 视觉方面:部分角度球体低模感明显,偶有白色方块悬浮,点击反馈缺失;UI 标签在密集区遮挡,镜头拉近时星球占比过大,边缘标签被裁切;材质变化有限。
  • 工程方面:构建后 JS 文件近 1MB 触发警告;验收脚本存在硬编码,后续扩充数据可能失步。

综合来看,Qwen3.8-Max 已能独立处理技术选型、多文件协作、三维交互及错误修复,将复杂需求推进至可运行的前端 MVP 阶段,短板主要在于视觉精修、空间构图及长期可维护性。

测试二:同一项目迭代,ChatGPT 5.6 VS Qwen3.8 Max

在第一轮测试基础上,分别通过 Qwen Code 和 ChatGPT 桌面版 Codex 调用 Qwen3.8-Max 与 GPT-5.6,要求两者对已有项目进行三类优化:提升 3D 视觉氛围、补全最新模型数据并改进交互、增加产品级功能。以此对比两者的理解、修改、验证和收敛能力。

结论先行:

  • GPT-5.6:像高效的外包商,逻辑是“功能优先”,迅速收尾交付 MVP,但缺乏细节打磨。
  • Qwen 3.8-Max:像有强迫症的顶级架构师,不满足于“能跑”,花费大量时间打磨质感、光影和平滑度。

GPT-5.6:37 分钟完成任务

(GPT5.6 运行成果截图)

ChatGPT 侧运行约37 分钟,Codex 额度消耗约6%

其优势在于速度快。Codex 迅速识别项目结构,完成材质、交互、时间轴等调整,并编写验证脚本。流程利落,无长时间重试或高额消耗。

但实际效果存在差距:虽然完成了功能层需求,但未充分转化为产品层改善。星球材质与光影依然有限,缺乏科幻感与浪漫气质;2026 年最新数据未完整补全,占位内容未彻底清理。整体完成度低于提示词要求,更像是一个效率优先的工程助手。

Qwen3.8-Max:三个半小时,更高的完成质量

(Qwen 3.8 Max 运行成果截图)

(Qwen 3.8 Max 运行成果截图)

Qwen 3.8 Max 的页面完成度明显更高。球体体积、纹理和空间层次得到加强,节点区分清晰,搜索与镜头聚焦更接近“宇宙导航”入口,整体氛围符合深空科幻要求。

在数据更新上,Qwen 尝试联网补充信息并清理示例内容。相比 GPT-5.6 的快速交付,Qwen 继续处理视觉、数据和细节,换来了更高完成度,但也消耗了更多时间和 Token。

第二轮迭代中,Qwen Code 累计运行3 小时 29 分钟,发起195 次请求,处理约 1664 万输入 Token,缓存率为88.6%

任务最终因 Token Plan 滚动额度耗尽而中断,返回429 insufficient_quota。此时上下文窗口仅使用约 21.9%,限制主要来自持续的工具调用、多轮验证和反复修改。

从效率看,Qwen 付出了更高代价:更多轮次的修改、检查、超时与重试。虽遵循提示词完成了开发,但未完成最终验收。

更高完成度来自更深的执行循环

实测表明,Qwen3.8-Max 通过反复读取、修改和验证迭代细节,页面完成度高于 GPT-5.6。两者对“完成”定义不同:GPT 接受“可用”,Qwen 追求“接近产品要求”。

独立开发者测试也发现,Qwen3.8-Max 在多项任务中耗时最长,常被概括为“质量很高,但速度很慢”。这种“过度思考”包含推理阶段的 Token 消耗和 Agent 执行阶段的工具调用消耗。本轮测试确认后者消耗显著。

这套执行方式的优势是模型愿意检查更多问题,不过早停止;代价则是时间长、成本高,且后续每一轮修改的收益递减。长程 Agent 的评价需加入时间、预算和完成判断。上下文长度解决了持续理解问题,但工具调用的有效性与任务结束的判断决定了最终成本。

进入真实工作流后,多一轮读取与重试都会转化为费用与延迟。Qwen3.8-Max 证明了其能将复杂项目推向更高完成度,接下来需证明能否减少低效循环,在可控预算内完成验收。

同时,这种“固执”揭示了另一种选择:在高预算、高复杂度场景(如大规模重构、芯片优化)中,这种“不计代价”的闭环迭代可能是跨越 AGI 落地鸿沟的有效路径。

Max 守住前沿牌桌,Agent 才是阿里的扩张通道

两轮测试勾勒出 Qwen3.8-Max 的轮廓:具备较强的长程任务能力,愿投入更多计算以换取高完成度,代价是更长的时间与更高的 Token 消耗。

Max 证明了 Qwen 的能力上限,但商业落地需更复杂的分工。阿里策略是让不同模型和产品分担角色:Max 负责前沿能力,小模型扩大采用,Qwen Code 和千问办公承接具体任务,阿里云负责交付。

8 月 3 日,千问办公与 Qwen3.8-Max 同步开放,信号明确:Max 旨在进入代码、文档等企业真实工作流。这也使得实测中暴露的成本与效率问题更为关键。长程 Agent 不仅需证明能持续推进任务,还需在可控预算内判断交付标准并及时结束。

Max 在阿里体系中的定位清晰:守住前沿模型牌桌,提供能力上限;真正承担扩张任务的是小模型、Agent 产品及企业交付能力。阿里的目标是将 Qwen 打造成覆盖开发、办公和企业服务的 Agent 能力底座。Max 能否产生规模化价值,取决于其能力能否通过执行系统以稳定、适合的方式进入真实工作。

【声明】内容源于网络
0
0
AI科技评论
聚焦AI前沿研究,关注AI工程落地。
内容 8883
粉丝 0
AI科技评论 聚焦AI前沿研究,关注AI工程落地。
总阅读208.8k
粉丝0
内容8.9k