最近,国外各大 AI 公司开始集中发布模型更新,国内这边的厂商也不甘示弱。
前两天,月之暗面也悄悄放了个大招,宣布正式发布其最新模型:Kimi K3。
仔细一看,好家伙,模型参数直接到 2.8 万亿,一举登顶,成为全球参数规模最大的开源模型。
模型发布后,AI 权威基准评测 Artificial Analysis 机构对 K3 进行了测评。
最终结果惊艳众人,K3 得分仅次于 Fable 5 和 GPT-5.6 Sol,超过榜上其他所有模型。
同时,模型竞技场 Arena.ai 也公布了他们的测试结果,在前端评测中,K3 以 1679 分一举登顶。
排在 Fable 5 和 GPT-5.6 Sol 的前面,并且在前端 7 个细分领域里拿下 6 个第一,只在游戏场景输给 Fable 5。
另外,我还注意到一点,Kimi 上个模型 K2.6 还排在 18 名,短短三个月,直接干到第一,着实凶猛。
除了编程之外,这次官方还秀了一把 K3 的知识工作能力,其中有个例子让我印象挺深。
它经过 120 多轮自我改进,做了 2800 多次搜索、一口气啃完 11000 页资料。
最后交出一份覆盖 ASIC 芯片行业 42 年历史的研究报告。这个能力用在让 Agent 做调研非常不错。
不止做调研,还看到 Kimi 官方还让 K3 用 56 段原始素材,给自己剪了一条品牌视频。
选片、卡点、音频处理全是它自己来,这种活平时得让有经验的剪辑师花上一两天。
的确有点牛,主要靠 K3 原生多模态能力,文字、图像、视频在同一个模型里就能处理。
说真的,这还是我第一次看到国外各大知名评测机构,给了国产开源大模型这么高的评分。
那是不是真的这么厉害?
为了打消这个困惑,我在一个真实项目上试了试它的编程能力。
上周,我刚做了一款「2026 世界杯赛事追踪」应用,恰巧近期世界杯即将迎来决赛。
因此,我便打算给网站增添一些紧张氛围,加一个「世界杯冠军预测」功能。
在 Kimi Code 上,让 K3 来帮忙实现这功能,看下它的编程能力具体如何。
实测一:代码理解能力
这次 K3 模型已支持百万 Token 上下文,相当于能吞下一整个复杂大型项目的代码库。
我直接让它了解整个项目的全部代码,包括架构、功能、API 数据等等所有信息。
很快,它便掌握了项目所有信息,甚至还把代码里存在的问题列了出来,并顺手修复了。
现在 K3 对整个项目的代码库已经有了个清晰的理解,下一步就可以对项目进行功能开发了。
实测二:前端审美能力
先让大家看下,上周在 Claude Code 上用 Fable 模型做的「世界杯赛事追踪」应用。
重新打开应用看到首页这个页面,感觉当时 Fable 模型做出来的效果实在太丑了。
所以我想着让 K3 帮忙重新搞一个,要求页面要有决赛氛围感。
跑了一下,最终结果如下所示,大家可以感受一下。
不得不说,K3 模型的审美真的顶,尤其是中间那个「 3D 大力神杯」立体效果特别好。
以前测试过不少模型开发前端页面,很多都是基本不做移动端适配的。
然后我特意在移动端上看了下页面展示效果,没想到 K3 的适配效果也颇为完美。
实测三:全栈编程能力
不过此前 Kimi 的前端编码能力一直挺强,这次我想稍微上下难度,给网站新增一个「预测世界杯冠军」功能。
大家可以给自己心中看好的球队进行投票,并且能实时查看参与投票人数以及支持率。
这功能实现涉及改动前端界面、后端 API 接口、搭建数据库,防止刷票等复杂处理。
主要考验的是 K3 模型的全栈编程能力,以及是否能够持续长时间完成高难度的复杂开发任务。
在实现过程中,我意外地发现了它竟然能够调用工具自我测试,发现问题时主动修复。
这里可以看到, K3 的确能在没有人工的干预下,能连续长时间完成复杂的开发任务。
并且还会操作终端和各种开发工具,在代码和实时截图之间来回调试,自己看效果自己改。
最终实现的效果如下图,模型的审美依然在线。
左右是两大阵营的卡片信息。
里面有球队过往真实的比赛数据,以及可以给自己支持的球队进行投票。
投票完显示实时投票人数和支持率,也说明了已实现功能的前后端全栈逻辑。
写在最后
实测体验完 K3,给我的感觉相当不错,比预期的效果好不少。
前端审美从 K2.5 开始就没让我失望过,这次的决赛氛围改版,依旧在线。
另外在这几个实打实的实测开发场景里,我的感觉它能摸到 GPT-5.6 Sol 模型的水平。
当然它也不是没毛病,Kimi 官方也承认了 K3 存在一些缺陷。
比如模型有时会过于主动,需求没说细的地方,它可能就自作主张先干了。也坦言和 Fable 5、Sol 相比仍有差距。
不过这个差距,已经不再是当年那种,连国外顶级闭源模型车尾都看不到的鸿沟。
把时间拉长看,这个差距本身,就是一部追赶史。
过去三年,国产 AI 一直在回答同一个问题:
我们离世界最顶级的模型,到底还差多远?
从当年隔着一整个版本仰望 ChatGPT,到后面 DeepSeek 撕开一道口子,再到今天 K3 站上开源之巅。
这个问题的答案,从一开始的差几年,到现在变成了差半步。
在我看来,K3 不仅是 Kimi 的答卷,也是中国在这一轮人工智能浪潮中,交出的一份阶段性答卷。
———
本次 Kimi K3 API 的定价,其实与 Claude Sonnet 系列模型差不多。
相当于 K3 用 Sonnet 模型的价格,就能拥有比肩 Opus 4.8 的能力。
怪不得很多人在体验模型后,毫不犹豫就冲了 Coding Plan 套餐。
目前 Kimi K3 已在官网、App、Kimi Code 、Kimi Work 以及 API 开放平台全面上线,大家可以体验试试。
今天的分享到此结束,感谢大家抽空阅读,我们下期再见,Respect!

