大数跨境

一个月9款旗舰,大模型进入“月抛”时代?

一个月9款旗舰,大模型进入“月抛”时代? 鸟哥笔记
2026-08-06
2
作者:雷晶 | 编辑:金玙璠 | 来源:定焦 One(ID:dingjiaoone)
一个月内,9 款旗舰模型扎堆发布,这在在大模型行业实属罕见。从月初腾讯混元 Hy3 开源正式版,到月末 Anthropic 推出 Claude Opus 5,其间 Kimi K3、Qwen3.8-Max 预览版、Grok 4.5 等模型密集登场,使 7 月成为近一年来的发布高峰。
各家发布时间策略各异:有的借竞品更新间隙跟进,有的选在世界人工智能大会前后亮相,亦有厂商通过价格调整回应竞争。但这轮发布潮不仅数量惊人,更折射出行业两大关键变化:
第一,模型能力差距显著缩小。Artificial Analysis 最新综合智能指数显示,头部模型分差明显收窄。随着版本快速迭代,“最强模型”难以长期霸榜,各家转而围绕特定任务构建优势,不再单纯追求单一维度的绝对领先。
第二,开源模型跻身第一梯队。7 月发布的腾讯混元 Hy3、Kimi K3 等均选择开放权重。其中,Kimi K3 在 Code Arena 前端编程榜单中超越 GPT-5.6 Sol 和 Claude Fable 5 位居榜首。这表明开源模型已不再是闭源模型的追赶者,而是在部分开发场景中具备了直接竞争力。
这场密集发布究竟带来了哪些深层变革?

不再只比谁更聪明

过去几年,大模型竞争聚焦于通用能力,比拼知识面与回答准确度。如今,竞争维度已发生根本性转变。

代码能力成核心争夺点

OpenAI 持续强化编程与复杂推理,扩展 Codex 生态以绑定开发者;Anthropic 押注代码理解与安全审计,解决大型工程难题;Grok 4.5 则主打速度与低成本,并与 AI 编程工具 Cursor 深度绑定。大模型研究者姚宇航指出,各家公司重点投入编程能力,差距正在快速缩小,如 Kimi K3 的代码能力已接近头部闭源模型水平。
图源 / pexels

Agent 争夺战与落地瓶颈

Agent(智能体)是另一大竞争高地。GPT-5.6 Sol 探索自动化编程,Opus 5 强调长程任务执行,Kimi K3 展示连续运行能力,腾讯混元 Hy3 则尝试结合微信生态。然而,Agent 在实际应用中仍显稚嫩。独立开发者北城指出,当前短板在于任务调度能力而非工具调用。例如,Codex Ultra 模式虽开启多个子代理,却存在重复读取文件、Token 消耗激增但有效产出不足的问题。关键在于能否智能判断任务价值与步骤精简。
姚宇航认为,智能体是未来关键方向,但距成熟尚有距离。下一阶段差距将取决于在具体场景(如医疗、金融)中的实用性与商业付费意愿。

参数规模与推理效率的博弈

7 月多款模型进入万亿参数区间,但参数规模不再等同于能力。随着 MoE 架构发展,模型可在拥有大容量参数的同时,仅激活小部分进行推理,从而降低成本。行业由此分化出两条路线:一是扩大规模换取更强能力;二是提升效率,用小激活参数实现旗舰效果。

价格战与差异化定价

价格成为最直接的竞争变量。海外厂商采取差异化策略:OpenAI 细分市场,按任务复杂度提供不同版本;Anthropic 维持高性能旗舰路线;Grok 4.5 则以低价策略(仅为 Opus 系列四分之一)绑定 Cursor 吸引开发者。国内厂商则普遍强调成本优势,持续下调 API 价格以降低门槛,扩大用户规模。
综上,7 月的大模型竞争已从单一能力比拼,扩展至代码、智能体、参数效率和价格的多维较量。

谁超出预期,谁评价两极?

综合代际变化、榜单表现及开发者反馈,7 月发布的模型可分为三类。

超出预期:Kimi K3、Grok 4.5、混元 Hy3

Kimi K3最受关注。其采用 MoE 架构,总参数达万亿级,强化长上下文、前端编程及产品设计能力。发布当天即以 1679 分登顶 Code Arena 前端编程榜,较前代提升 17 位,并首次闯入全球综合榜 Top 10。但其也存在明显短板:幻觉率升至 51%,输出速度仅约 33 Token/s。开发者反馈其在前端开发与 UI 设计表现出色,但在复杂工程任务中稳定性不足。
图源 / pexels
Grok 4.5凭借速度与性价比脱颖而出。其在部分工具调用测试中表现优异,适合快速开发场景。得益于 SpaceX 收购 Cursor 母公司及数据合作,Grok 4.5 搭配 Cursor 的体验得到显著优化。
混元 Hy3代表效率路线突破。其总参数 295B,激活参数仅 21B,以不到旗舰模型五分之一的规模,在多个基准测试中成绩接近大体量竞品。不过在 SWE-Bench Pro 复杂代码修复测试中,与 Claude Opus 4.8 仍有差距。

稳定但惊喜有限:GPT-5.6 Sol、Claude Opus 5

这两款模型稳居第一梯队,但未带来颠覆性变化。GPT-5.6 Sol 强化复杂推理与智能体编程,在 Terminal-Bench 测试中表现优异;Claude Opus 5 则在复杂工程、代码理解及安全分析中保持高可靠性,且价格仅为同类旗舰的一半。开发者将其视为解决关键难题的“专家”工具,日常开发则更多依赖高性价比模型。

反馈分化:Gemini 3.6 Flash、Qwen3.8-Max 预览版

Gemini 3.6 Flash智能指数与前代持平,社区反馈提升不明显,但其多模态理解与文件处理能力仍获认可,日常聊天体验出色。
Qwen3.8-Max 预览版表现不稳定。有开发者指出其思考深度高但易陷入无效推理,实际能力与宣传存在差距。作为预览版产品,其最终表现尚待正式版验证。
7 月未出现全维度领先的模型,不同模型开始围绕具体场景形成分工。开发者倾向于组合使用:用 GPT-5.6 处理日常开发,Grok 4.5 应对快速需求,Kimi K3 负责前端设计,Claude Opus 5 攻克复杂难题。

发布加速与开源闭源之争升温

这轮密集发布背后,折射出模型迭代加速、时间节点叠加及商业模式重构三大趋势。

迭代方式变革:从重新训练到后训练优化

过去模型升级依赖耗时耗力的重新训练,如今随着强化学习与后训练技术成熟,模型升级更多依赖基础模型上的微调与优化。这导致竞争周期大幅缩短,领先窗口可能仅剩几周,发布节奏本身已成为竞争策略的一部分。
图源 / pexels

时间节点叠加:WAIC 与全球竞争共振

7 月是国内世界人工智能大会(WAIC)举办期,国内厂商集中亮相;海外头部公司亦选择此时更新模型,以抢占开发者生态与商业先机。

开源闭源之争:商业模式的重构

随着开源模型进入第一梯队,核心问题浮现:当高性能模型可免费获取,API 调用与订阅收入是否会遭分流?支持开源者认为这能降低门槛、推动生态;闭源阵营则担忧用户流失及安全风险。对英伟达等基础设施商而言,模型开放意味着更大算力市场;对 OpenAI 等模型商而言,闭源是维持收入的关键。对国内厂商,开放权重则是争取开发者生态与云服务入口的战略选择。
展望未来,DeepSeek V4 正式版、Fable 5.1、GPT-6 等新模型预计将于 8 月陆续发布。模型能力差距缩小的背景下,单靠发布更强模型难建长期优势。接下来的观察重点在于:开源模型的能力上限、API 价格走势、智能体付费场景的落地,以及开源模型在企业私有化部署中的渗透率。这些指标将比榜单名次更能揭示本轮混战的真正影响。
*题图来源于 pexels。
【声明】内容源于网络
0
0
鸟哥笔记
学运营推广,上鸟哥笔记!专注营销推广13年,累计助力数白万运营人成长的头部公众号。每天9点一篇热点营销/运营干货文章。
内容 13407
粉丝 0
鸟哥笔记 学运营推广,上鸟哥笔记!专注营销推广13年,累计助力数白万运营人成长的头部公众号。每天9点一篇热点营销/运营干货文章。
总阅读1037.6k
粉丝0
内容13.4k