大数跨境

阿里Qwen3.8正式发布:性能全球第一梯队,价格远低于Claude

阿里Qwen3.8正式发布:性能全球第一梯队,价格远低于Claude 电商派Pro
2026-08-04
5
导读:行业拐点已经到来。

行业拐点已经到来。

出品 | 电商派 Pro   作者 | 老电团队

Qwen3.8-Max 发布:编程与办公能力全面跃升

日前,阿里巴巴正式发布新一代基座大模型 Qwen3.8,其在编程(Coding)和专业办公(Cowork)领域的能力实现大幅突破。行业测试反馈显示,该模型回归了用户期待的高水准表现。

参数规模与性能突破

Qwen3.8-Max 首次将千问大模型总参数量拓展至 2.4T,激活参数量达 95B,显著提升了推理效率与速度。模型支持 1M Tokens 上下文长度及视觉理解功能,是阿里迄今为止规模最大、性能最强的模型。

在权威榜单 Arena 中,Qwen3.8-Max 以 1496 分位居全球第二,仅次于 Anthropic 的 Claude 系列。在 Code Arena(编程)和 Vision Arena(视觉理解)细分榜单上,该模型均稳居全球第一梯队。

极致性价比与普惠访问

除了性能强劲,Qwen3.8-Max 在定价上也极具竞争力。国内价格为输入 12 元/百万 Tokens、输出 36 元/百万 Tokens,隐式缓存命中仅 1.5 元;国际价格仅为 Claude Opus5 的 40%(输入)与 24%(输出)。目前,全球开发者均可通过千问 AI 平台直接调用 API。

同日,“千问办公”开启公测,内置 Qwen3.8-Max 模型。用户无需代码基础或配置开发环境,即可通过网页版和 PC 客户端直接使用。

从参数竞赛到落地交付:真实场景实测

在大模型竞争的下半场,核心指标已从单纯的参数跑分转向实际业务价值——即能否帮企业干活、省钱、提效。Qwen3.8-Max 的核心优势在于推动复杂任务的端到端闭环完成。

多维度的端到端执行能力

测试数据显示,该模型在多个维度展现出强大的自主执行能力:

  • 编程方面:能从空文件夹出发,自主运行约 16 天,完成从需求理解、工程搭建到运行验证的全流程,交付完整开源项目。
  • 长程任务:在模拟 365 天的电商经营中,能根据反馈持续调整策略,最终实现最高 4 倍回报。
  • 专业工作:处理数百份法律文档仅需一小时(人工需一周);能在数十分钟内拆解 160 小时比赛录像,生成包含 8400 多个攻防回合的战术报告
  • 多模态智能体:可理解约 200 页财报及复杂 PDF,处理超 100 小时长视频,并自动完成信息分析、内容整理或 Vlog 剪辑。

实测一:深度财报分析与洞察

为验证其在办公与知识处理方面的能力,我们将亚马逊 2026 年 Q2 全英文财报(十余页)交由 Qwen3.8-Max 处理,要求提取核心数据、识别风险并输出分析报告。

模型迅速生成了一份 5000 字的完整汇报提纲,不仅包含"30 秒摘要”,且每条结论均标注原文出处和页码。例如,它精准指出 Q2 净利润 626 亿美元中,有 534 亿美元来自对 Anthropic 投资的重估收益,剔除后主业净利润约 210 亿美元,得出“利润高增有水分,但主业改善为实”的深度判断。

此外,报告还列出了自由现金流转负、长期债务激增等 8 条关键风险信号,并基于 Alexa for Shopping 数据拆解了“代理式购物”对国内即时零售及 AI 导购赛道的影响。

实测二:电商营销方案自动生成

针对商家日常需求,我们输入店铺基本信息,要求生成新品上市营销方案。Qwen3.8-Max 输出了包含完整方案、逐日排期甘特图及分模块执行清单在内的三件套。

方案将周期细分为准备、预热、爆发、返场四个阶段,明确各阶段任务与预算。甘特图按天排列 30 多个节点,涵盖卖点提炼、KOC 建联、搜推排期等全链路环节。执行清单则细化为 6 个模块、42 条任务,甚至精确到 KOC 铺量预算(7500 元)及达人背书费用(3000 元)。

更关键的是,模型还设定了动态规则,如“渠道 ROI 连续两天低于 2.0 则砍掉 50% 预算”,并规划了每日盯盘指标。这意味着中小商家无需专业策划团队,即可在十几分钟内获得一份结构完整、可直接落地的运营方案。

行业标杆用户的真实反馈

目前,Qwen3.8-Max 已深入多个行业的真实业务场景:

  • 物流场景:菜鸟研发总监郭凤钊表示,该模型在交付流水线中自主完成了从设计、编码到部署的全链路,解决了多环节系统性一致的难题,实现了单次启动即可闭环。
  • 法律服务金杜律师事务所合伙人瞿淼指出,模型在法律检索中反馈精准、必有出处,且在不确定时主动提示而非编造,守住了法律行业的严谨底线。
  • 企业开发:网易智企 CodeWave 技术负责人姜天意认为,在该模型加持下,企业级 AI 编程实现了 Spec 驱动下的代码可维护与可迭代,开发效率翻倍且成本大幅下降,让 AI 编程真正可用于生产项目。

大模型竞争下半场:从跑分到交付

全球最大的模型 API 聚合平台 OpenRouter 数据显示,美国企业调用中国模型的 Token 份额已从 2025 年初的 4.5% 攀升至今年 7 月的 63%,创下历史新高,且榜单前十名多为国产模型。

这一大规模迁移背后源于三大核心条件:

  1. 性能够用:以 Qwen 为代表的国产模型在编程、Agent 等主流场景已具备极强竞争力。
  2. 价格优势:中国开源模型使用成本比 Anthropic 和 OpenAI 便宜 60% 至 90%,助力企业大幅节省开支。
  3. 开放权重建立信任:企业可自行部署审计。Qwen 系列累计开源超 400 款模型,下载量破 10 亿次,是全球第一开源模型家族。Qwen3.8-Max 预计将于下周开源,同时还将开源 Qwen3.8-27B。

值得注意的是,这些调用中占比极高的是替企业干活的 Agent 工作流,而非闲聊。这表明 63% 的市场份额是靠实打实的业务应用赢得的。

综上所述,Qwen3.8 系列在各个场景下的表现证明,大模型的竞争终究不是比拼参数大小,而是看谁能率先帮企业把活干了、把效率提上去。

【声明】内容源于网络
0
0
电商派Pro
电商派Pro
内容 13144
粉丝 0
电商派Pro 电商派Pro
总阅读222.7k
粉丝0
内容13.1k