大数跨境

中国开放模型 Kimi K3 冲进前三:AI 前沿不再只属于闭源巨头

中国开放模型 Kimi K3 冲进前三:AI 前沿不再只属于闭源巨头 AI大模型观察站
2026-07-22
2
导读:Kimi K3 以开放权重、2.8 万亿参数和低成本推理逼近 Claude、GPT 等前沿模型,并在前端代码盲测中领先。

Claude Fable 5 仍然位居 Intelligence Index 榜首,甚至 GPT-5.6 Sol 也未能超越它。随后,一个来自中国、拥有 2.8 万亿参数的开放模型拿下第三名,距离榜首不到三分,并且在前端代码上直接击败了 Fable。

7 月 16 日,开发者在 Frontend Code Arena 上对代码进行排名,但并不知道代码是谁写的。盲测。参与者包括 Claude Fable 5 和 GPT-5.6 Sol,这两个都是你能租用到的最昂贵系统之一。最终同时超过它们的,是一个中国以外大多数人从未运行过的模型。Kimi K3。开放权重。由位于北京的 Moonshot 打造。

关于开放模型,尤其是中国开放模型,原本有两件事被认为理所当然。它们落后封闭前沿模型大约一年。即便参与竞争,它们竞争的是价格,而不是能力。Kimi K3 在发布第一天就打破了这两点。

先看它击败的目标。在综合性的 Artificial Analysis Intelligence Index (https://artificialanalysis.ai/) 上,Claude Fable 5 仍然排名第一,而 OpenAI 的旗舰模型 GPT-5.6 Sol 只低它一分。因此,这个出现在榜单顶端附近的开放模型,并不是在追赶什么软柿子。它进入了前三,距离那个连 OpenAI 都无法超越的第一名不到三分。

**简短版:**一个开放模型刚刚冲进排行榜前三,在盲测中击败了前端代码排名第一的系统,并把价格定在接近 Opus 4.8 的一半。权重将于 7 月 27 日公开。当天花板变成你可以自己运行的东西时,它就不再是前沿,而会变成其他所有人必须跨过的标准。

优势曾经是别人没有的能力。7 月 27 日,这种能力将变成任何人都可以下载并运行的模型。


Moonshot 发布了什么

Kimi K3 是一个 mixture of experts 模型,总参数量为 2.8 万亿,在任意给定 token 上大约激活 500 亿参数。它可以读取一百万 token 的上下文,原生理解图像,并且现在已经可以通过 Moonshot 的 API 运行。完整权重计划于 7 月 27 日发布。

光是规模就足以让人停止滑动页面。Moonshot 自己的 scaling chart 显示,K3 远远高于此前所有开放模型:DeepSeek 为 1.6 万亿,Xiaomi 约为 1.02 万亿,Alibaba 为 3970 亿。这不是一次轻推排行榜的开放发布。它代表着开放权重模型有史以来规模的一次阶跃式变化。

规模本身证明不了任何事情。一个 2.8 万亿参数模型如果表现得像中等水平系统,那只不过是一种昂贵的失败方式。真正令人不安的是分数。


Fable 5 仍然第一。一个开放模型刚刚拿下第三。

在 Artificial Analysis Intelligence Index v4.1 上,Claude Fable 5 以 59.9 领先。GPT-5.6 Sol 以 58.9 紧随其后。Kimi K3 以 57.1 位列第三,领先 Opus 4.8,而后者几周前还处在前沿位置。

第一名和第三名之间相差不到三分,而第三名是开放权重模型。

仔细看,情况会分化。Sol 在更窄的 Coding Agent Index 上领先,并且在成本上胜出;Fable 5 在质量综合指标上领先。K3 作为一个开放模型,进入同一个区间,这正是封闭实验室最不想看到的头条。具体到单项测试,它的表现更锋利:K3 在 Program Bench 上直接登顶,得分 77.8,超过 Sol 的 77.6 和 Fable 5 的 76.8。在 Terminal Bench 2.1 上,它达到 88.3,仅略低于 Sol 的 88.8,并明显高于 Fable 5 和 Opus 4.8,后两者同为 84.6。

这些数字中有相当一部分由 Moonshot 自己发布,而供应商给自己的作品打分当然有动机。这个模型才发布几天。把所有项目合计起来看,Fable 5 仍然赢下了最多的单项正面对比。K3 做到的是进入了地球上两个最佳封闭模型所在的同一档位,而不是低它们一档。


前端和游戏:由人来评判的地方

基准测试可以争论。一个游戏要么能渲染,要么不能,这就没那么容易包装了;在这类工作上,评分的是人类,而不是供应商。

Frontend Code Arena 上的盲投结果把 K3 排在第一,得分 1,679,高于 Fable 5 的 1,631,并领先所有美国主流模型。随后,社区在一天之内就跟进了。Moonshot 官方 Kimi K3 技术博客展示了 K3 构建一个程序生成的 3D open-world game,该游戏完全在浏览器中运行,使用 Three.js、WebGPU 和 GPU compute。 它还生成了一个 Long March 10 火箭发射与返回模拟,以及一个可运行的 Game Boy Advance emulator。

前端和交互式代码很难伪装。它要么能跑,要么报错;它看起来要么正确,要么破碎;一个人无需评分细则,大约两秒就能看出差别。当开发者在看不见自己评的是谁的模型的测试中,把一个模型在这类任务上排到第一,这个结果的分量超过任何自报 eval。这正是最能推动认知变化的证据,超过任何单独一行基准分数。


价格为何能降到这么低

Moonshot 将 K3 定价为每百万 input tokens 3 美元、每百万 output tokens 15 美元,cache hits 则降到 30 美分。Latent Space 将其概括为以 Sonnet 5 的价格获得 Opus 4.8 级别的智能。Simon Willison 自己的一次运行显示,单个任务成本接近 94 美分,大约是同一任务在 Opus 4.8 上成本的一半。

有一项工程设计让这个价格成为可能。

长上下文模型中昂贵的部分是 attention。标准 attention 会将每个 token 与其他所有 token 进行比较,因此随着上下文增长,成本会急剧上升;而一百万 token 窗口正是这种数学关系变得残酷的地方。K3 依赖 Kimi Delta Attention,这是一种 linear attention 方案,它保留紧凑的运行记忆,而不是在每一步都重新读取整个历史。可以想象成随身携带一份滚动摘要,而不是每增加一句话就重新读完整本书。Moonshot 报告称,在百万 token 上下文下,它的解码速度最高可提升 6.3 倍。更便宜的 inference 不是他们自己吞下的折扣。它是模型构建方式带来的属性。

这里还有没人预料到的一点。这不是过去那种逐底竞争。The Decoder 将这次发布解读为超低价中国 AI 时代的结束,这个解读是对的。Moonshot 把 K3 的价格往上定,朝顶端靠近,而不是压在下面。一个认为自己只有二线模型的实验室,会用低价击穿所有人来买关注。Moonshot 的定价方式表明,它相信 K3 有资格进入这场对话。

为什么这会逼住 Google、OpenAI 和 Anthropic

封闭实验室一直掌握的杠杆,建立在两件事上:能力领先,以及因为没有别的东西接近它而必须支付的价格。K3 同时冲击了这两点。

一个权重将在 7 月 27 日公开的模型,已经越过了一个月前定义前沿的门槛,因为它领先 Opus 4.8。一旦天花板变成团队可以自己托管的东西,它就会变成地板。每个收取前沿价格的实验室,现在都必须证明其溢价相对于一个客户可以在自己硬件上运行的模型是合理的,并且必须跨过一个明显更高的门槛,才值得用户付费。这一周的销售难度,比上一周更高了。

前沿仍在移动。封闭模型每隔几个月就会抬高门槛。一个任何人都可以运行的前沿级开放模型,会改变等式。DeepSeek 和 Llama 都曾在一段时间内重塑格局。如果 Kimi K3 的早期基准表现能在更广泛的真实世界测试中站住脚,它也有机会做到同样的事。


唯一可能戳破这一切的事情

权重要到 7 月 27 日才会发布,因此 Moonshot 之外还没有人能在自己的硬件上运行 K3,而且基准表的一部分来自 Moonshot 自己的报告,而不是外部实验室。我们已经拥有的第三方数字——综合 Intelligence Index 和盲测 Arena——也才发布几天。这个模型还只提供一个 reasoning 设置,叫做 max,并且效果很明显:Willison 看到它花了 13,241 个 reasoning tokens 来生成一个 3,417 token 的回答,甚至一个简单的 “hi” 返回时也被计为 86 个 token,暗示存在一个模型拒绝透露的隐藏 system prompt。

所有这些质疑都是合理的。但没有一项改变核心事实。一个开放模型能进入前三,并且接近到可以和最佳封闭系统相提并论,这本身就是事件,而不是脚注。保留意见决定的是这件事有多大,而不是它是否发生。

真正算数的是下一次投票

真正重要的投票不是 Arena 上那次盲投。而是 7 月 27 日那次:当 2.8 万亿参数变成公开下载,团队将决定是否把原本付费给 Opus 处理的工作,改为交给一个自己运行的模型。如果其中哪怕只有一小部分留下来,标准也已经永久移动,而每个收取前沿价格的实验室,突然都在为客户可以 self host 的东西收费。

这就留下了一个值得思考的问题。当你能自己运行的最佳模型只落后于你能租用的最佳模型一个版本时,这笔溢价到底买的是什么?

如果你已经用 K3 跑过自己的前端或 agent 工作负载,请留下哪些地方经住了考验、哪些地方出了问题。来自真实工作的现场报告,比任何发布当天的排行榜都更有价值。




    【声明】内容源于网络
    0
    0
    AI大模型观察站
    专注于人工智能大模型的最新进展,涵盖Transformer架构、LLM训练优化、推理加速、多模态应用等核心技术领域。通过深度解析论文、开源项目和行业动态,揭示大模型技术的演进趋势,助力开发者、研究者和AI爱好者把握前沿创新。
    内容 396
    粉丝 0
    AI大模型观察站 专注于人工智能大模型的最新进展,涵盖Transformer架构、LLM训练优化、推理加速、多模态应用等核心技术领域。通过深度解析论文、开源项目和行业动态,揭示大模型技术的演进趋势,助力开发者、研究者和AI爱好者把握前沿创新。
    总阅读8.8k
    粉丝0
    内容396