大数跨境

都说自己是第一,中国最强的大模型到底是谁?

都说自己是第一,中国最强的大模型到底是谁? 砺石商业评论
2026-09-01
6
一个较为客观的表述是:中国大模型第一梯队已形成 Kimi K3 与 Qwen3.8-Max 的双雄格局。前者胜在国际验证,后者胜在中文综合与生态。

陈凯 | 作者
平凡 | 编辑

砺石商业评论 | 出品

当前,中国大模型行业出现了一种奇特现象:几乎每家头部公司都宣称自己的模型是“中国第一”甚至“全球前三”。阿里称 Qwen3.8-Max“第三方盲测仅次于 Claude";月之暗面称 Kimi K3 为“全球最强开源模型”;智谱称 GLM-5.2"Code Arena 全球第一”;DeepSeek 标注"SWE-bench Verified 80.6%";字节豆包 2.1 宣称"IMO 金牌、HLE 全球领先”;百度文心 5.0 强调"10M 上下文、中文写作第一”。

这些说法虽各有依据,但均不完整。其共同特征在于,每个“第一”前都精心添加了限定定语:或是参数最大,或是单项基准最优,或是特定盲测榜榜首,亦或是在某价格档位领先。定语不同,结论自然互不冲突。这如同智能手机与新能源汽车行业,各家均在细分维度争夺“第一”头衔。

相比之下,美国大模型行业存在相对公认的格局。OpenAI、Anthropic 与 Google 轮流领跑,2026 年年中的共识是 Anthropic 重新夺魁,Claude Fable 5 在 Artificial Analysis 智能指数上以约 60 分排第一,GPT-5.6 Sol 以约 59 分居次席。这一共识由第三方评测机构、开发者社区及真实使用数据共同形成,无需依赖厂商发布会。

中国尚未形成此类共识,并非缺乏答案,而是被公关声浪掩盖。为此,本文抛开厂商自述,采用三类权威第三方验证数据进行交叉对照:Arena 全球盲测、Artificial Analysis 智能指数与 SuperCLUE 中文测评,以还原事实真相。

第一条证据链:Artificial Analysis 智能指数

Artificial Analysis(AA)是国际开发者社区引用最多的独立评测机构。其智能指数综合了数学、推理、代码、知识等多个维度的标准化测试,涵盖全球 189 款模型。该机构不接受厂商资助,测试口径统一,被视为目前最接近“客观”的第三方标尺。

截至 2026 年 8 月初,中国主要模型在 AA 智能指数上的表现如下:

  • 月之暗面 Kimi K3(Max):57 分,位列全球第 4。这是开源权重模型的历史最高排名,超越了 Claude Opus 4.8(约 56 分),仅次于 Claude Fable 5、GPT-5.6 Sol 及谷歌一款旗舰模型。
  • 智谱 GLM-5.2(Max):51 分,排在十名开外。
  • 深度求索 DeepSeek V4 Flash 0731:50 分,与谷歌 Gemini 3.6 Flash 持平。
  • 阿里 Qwen3.8-Max:暂无成绩。截至目前,AA 尚未完成评测。其上一代 Qwen3.7-Max 的成绩为 56.6 分,是该家族唯一的第三方参照。

数据透露两点关键信息:第一,中国最强模型已触及全球第一梯队门槛,Kimi K3 与榜首差距仅 3 分,较一年前的两位数差距大幅缩小;第二,“官方宣称最强”与“验证最强”存在差异,声称“仅次于 Claude Fable 5"的 Qwen3.8-Max,恰恰是头部模型中唯一缺乏第三方成绩的。

第二条证据链:Arena 盲测

Arena(arena.ai)采用人类盲测机制,通过数百万张用户投票换算成 ELO 积分,衡量的是“真人觉得谁更好用”。2026 年 8 月第 33 周榜单显示,国产模型表现如下:

综合榜中,Anthropic 的 Claude 系列包揽前五。国产模型中,Qwen3.8-Max 排第 8(ELO 1491),Kimi K3 Max 排第 12(1489),二者分差仅 2 分,基本并列,但 Qwen3.8-Max 位次略高。

代码榜中,Kimi K3 Max 排第 6(1544 分),是排名最高的国产代码模型;Qwen3.8-Max 排第 13,小米 Mimo 排第 25。

前端开发榜中,国产模型表现最为突出。Kimi K3 Max 以 1674 分排第 2,仅落后榜首 18 分;Qwen3.8-Max 排第 3;智谱 GLM-5.2-Max 排第 9;DeepSeek V4 Pro 新入榜即排第 10。此前 Kimi K3 曾短暂登顶该榜,创下国产模型在 Arena 实战榜单的全球首例第一。

智能体榜中,Kimi K3 Max 以 10.60% 的净提升度排第 5,与 Claude Opus 系列同处全球第一梯队;Qwen3.8 Max 排第 11;GLM 5.2 Max 排第 14;DeepSeek V4 Flash 排第 19。

综合四张榜单可见:在 Arena 体系中,Kimi K3 Max 是中国模型中覆盖面最广、位置最高的,各项指标均未掉出前十五;Qwen3.8-Max 则在综合榜上位列国产最高,但在代码与智能体等实战榜单上略逊于 Kimi。

第三条证据链:SuperCLUE 中文测评

SuperCLUE 是中文场景下最具公信力的第三方基准之一。2026 年 7 月榜单显示,12 款国产主流模型的综合总分排名前四依次为:Qwen3.8-Max、Kimi-K3、豆包 Doubao-Seed-2.1-Pro 与 DeepSeek-V4-Flash。

中文综合能力上,阿里 Qwen3.8-Max 排名第一,这与它在 Arena 综合榜的表现相互印证。字节豆包 2.1-Pro 排名第三,是“五强”中唯一未参加 Arena 国际盲测的模型,其能力在国内可见,但在国际坐标系中缺失。DeepSeek 排名第四,其曾经的领跑地位已被后来者取代。

编程专项上,SuperCLUE 给出了不同答案:GLM-5.2 以 64.13 分断层领先。智谱是典型的“偏科生”,虽在 Code Arena 和 Design Arena 等国际榜单拿过第一,但综合能力未能进入国内前四。

五家画像:各强的维度

2026 年夏天,五家头部公司在六周内密集发布前沿模型。综合三项证据链,其真实定位如下:

月之暗面 Kimi K3:验证维度上的中国第一。
作为人类历史上参数规模最大的开源模型(2.8 万亿参数),也是全球首个原生支持四模态的万亿级开源模型,Kimi K3 拥有最完整的第三方成绩单:AA 智能指数 57 分(全球第 4),Arena 前端第 2、代码第 6、智能体第 5,SuperCLUE 中文第二。FireworksAI 实测显示,其表现接近 Claude Fable 5,成本却仅为对方的 1/50。短板在于价格高昂,输出定价为 100 元/百万 token,是 DeepSeek V4 Flash 的 50 倍。

阿里 Qwen3.8-Max:中文综合与生态上的第一。
拥有 2.4 万亿参数,是 SuperCLUE 中文综合第一、Arena 综合榜国产最高。然而,其国际验证成绩单目前空白,AA 指数未出,官方基准均来自阿里自身。其核心护城河在于 Qwen 开源家族数年积累的全球下载量第一及深厚的衍生模型生态。

深度求索 DeepSeek V4:推理与性价比之王,但已被反超。
DeepSeek 曾在 2025 年初凭借 R1 模型引发全球震动。此后迭代节奏放缓,直至 2026 年 7 月底才重回牌桌。V4 Pro 在独立横评中推理单项表现优异,SWE-bench Verified 跑分为国产最高。V4 Flash 将价格压至 2 元/百万 token,成为 Agent 高频调用首选。但其 AA 智能指数为 50 分,综合排名已被 Kimi K3 和 Qwen3.8-Max 超越,从全球领跑者变为追赶者。

智谱 GLM-5.2:编程特长生。
基于华为昇腾训练,具有特殊战略意义。其在 Code Arena 等国际编程盲测榜上曾获全球第一,SuperCLUE 编程专项领先。但综合能力(AA 51 分)与第一梯队存在明显差距,推理任务表现偶有波动。

字节豆包 2.1-Pro:用户规模第一,国际验证缺位。
SuperCLUE 中文综合第三,响应速度最快,依托豆包 App 拥有国内最大 AI 用户群。但因缺席 Arena 国际盲测且 AA 指数查无此名,无法参与“全球坐标”排名。

直接回答这个问题

若以第三方验证的完整性和强度为标准,答案是月之暗面的 Kimi K3。它是目前唯一在所有主流国际评测体系中均有佳绩且进入全球前列的中国模型,是全球开发者社区用脚投票选出的冠军。

若以中文综合能力为标准,答案是阿里的 Qwen3.8-Max。其在中文语境下的综合表现目前无对手,加之庞大的开源生态,是产业渗透角度的隐形第一。但需注意,其国际标准化成绩单尚待填补。

因此,最诚实的表述是:中国大模型第一梯队呈现双雄格局——Kimi K3 与 Qwen3.8-Max,前者赢在国际验证,后者赢在中文综合与生态。DeepSeek V4、GLM-5.2、豆包 2.1-Pro 构成第二梯队,分别在推理、编程、用户规模上持有单项冠军牌。

对普通使用者而言,按场景选择优于盲目追求“最强”:写代码、做前端、跑 Agent 首选 Kimi K3;中文写作、超长文档处理首选 Qwen3.8-Max;高难度推理选 DeepSeek V4 Pro;预算敏感的高频调用选 DeepSeek V4 Flash;本地部署则可选开源的 Kimi K3、GLM-5.2 或 Qwen 家族。“没有全能王,组合使用”是深度用户的共识。

“人人第一”是怎么造出来的

为何中国会出现“每家都第一”的现象?拆解来看,各家说法在技术上并未撒谎,只是选择了对自己最有利的坐标系。阿里用的是 Arena 综合榜的国产排名;月之暗面用的是开源类目的参数规模和 AA 指数;智谱用的是编程单项榜单;DeepSeek 用的是单一标准化基准;字节用的是竞赛成绩和自建基准。

这套话术的公式是:换一个坐标系,就换出一个第一。能力维度、语言、规模、价格甚至硬件皆可作为切割维度。美国行业虽也有营销,但成熟的第三方评测机构和活跃的开发者社区舆论场形成了有效制衡。中国的评测基础设施正在补齐,但公关声量仍大于榜单音量。

面对“第一”宣称,只需追问三个问题:这个第一是在哪个坐标系里?坐标系由谁定义?同一坐标系下的第二、第三名是谁?大部分“第一”便会现出原形。

差距与时间

中国第一与世界第一的差距,目前在 AA 指数上体现为 3 分(57 对 60)。Kimi K3 超越的是 Anthropic 的上一代模型,而面对的是对手快速迭代的最新成果。美国综合榜前五名全被 Anthropic 包揽,这种集中度本身就是差距的体现。

但另一方面,中国模型从“落后一个身位”到"3 分之差”仅用了一年半。在开源领域,格局甚至已经反转:全球最强的开源权重模型(Kimi K3)、下载量最大的开源家族(Qwen)、生态最活跃的社区均在中国。

决定长跑胜负的变量还包括算力与生态。GLM-5.2 基于国产芯片训练,DeepSeek 以单位算力产出最大化为原则,Kimi 和 Qwen 的万亿级训练也依托于国产算力占比提升的集群。这是在算力约束下取得的效率创新。此外,商业模式与终端产品的差距也不容忽视,中国模型在 API 与开源生态上进展迅速,但缺乏全球级别的终端产品形成的数据飞轮。

模型行业的领先窗口以月计算。2025 年初属于 DeepSeek R1,2026 年年中属于 Kimi K3 和 Qwen3.8-Max。真正不变的结论只有一条:能被全球第三方榜单反复验证的名字,才是当下真正的第一。截至目前,这个名字是 Kimi K3。下一个是谁,让榜单说话,而非听厂商自说自话。

【声明】内容源于网络
0
0
砺石商业评论
各类跨境出海行业相关资讯
内容 6256
粉丝 0
砺石商业评论 各类跨境出海行业相关资讯
总阅读150.7k
粉丝0
内容6.3k