大数跨境

国产编程神器,Kimi K3 问世!

国产编程神器,Kimi K3 问世! GitHubDaily
2026-07-18
6

最近,国外各大 AI 公司开始集中发布模型更新,国内这边的厂商也不甘示弱。

前两天,月之暗面也悄悄放了个大招,宣布正式发布其最新模型:Kimi K3

仔细一看,好家伙,模型参数直接到 2.8 万亿,一举登顶,成为全球参数规模最大的开源模型。

模型发布后,AI 权威基准评测 Artificial Analysis 机构对 K3 进行了测评。

最终结果惊艳众人,K3 得分仅次于 Fable 5 和 GPT-5.6 Sol,超过榜上其他所有模型。

同时,模型竞技场 Arena.ai 也公布了他们的测试结果,在前端评测中,K3 以 1679 分一举登顶。

排在 Fable 5 和 GPT-5.6 Sol 的前面,并且在前端 7 个细分领域里拿下 6 个第一,只在游戏场景输给 Fable 5。

另外,我还注意到一点,Kimi 上个模型 K2.6 还排在 18 名,短短三个月,直接干到第一,着实凶猛。

除了编程之外,这次官方还秀了一把 K3 的知识工作能力,其中有个例子让我印象挺深。

它经过 120 多轮自我改进,做了 2800 多次搜索、一口气啃完 11000 页资料。

最后交出一份覆盖 ASIC 芯片行业 42 年历史的研究报告。这个能力用在让 Agent 做调研非常不错。

img

不止做调研,还看到 Kimi 官方还让 K3 用 56 段原始素材,给自己剪了一条品牌视频。

选片、卡点、音频处理全是它自己来,这种活平时得让有经验的剪辑师花上一两天。

的确有点牛,主要靠 K3 原生多模态能力,文字、图像、视频在同一个模型里就能处理。

说真的,这还是我第一次看到国外各大知名评测机构,给了国产开源大模型这么高的评分。

那是不是真的这么厉害?

为了打消这个困惑,我在一个真实项目上试了试它的编程能力。

上周,我刚做了一款「2026 世界杯赛事追踪」应用,恰巧近期世界杯即将迎来决赛。

因此,我便打算给网站增添一些紧张氛围,加一个「世界杯冠军预测」功能。

在 Kimi Code 上,让 K3 来帮忙实现这功能,看下它的编程能力具体如何。

实测一:代码理解能力

这次 K3 模型已支持百万 Token 上下文,相当于能吞下一整个复杂大型项目的代码库。

我直接让它了解整个项目的全部代码,包括架构、功能、API 数据等等所有信息。

很快,它便掌握了项目所有信息,甚至还把代码里存在的问题列了出来,并顺手修复了。

img

现在 K3 对整个项目的代码库已经有了个清晰的理解,下一步就可以对项目进行功能开发了。

实测二:前端审美能力

先让大家看下,上周在 Claude Code 上用 Fable 模型做的「世界杯赛事追踪」应用。

重新打开应用看到首页这个页面,感觉当时 Fable 模型做出来的效果实在太丑了。

所以我想着让 K3 帮忙重新搞一个,要求页面要有决赛氛围感。

跑了一下,最终结果如下所示,大家可以感受一下。

不得不说,K3 模型的审美真的顶,尤其是中间那个「 3D 大力神杯」立体效果特别好。

以前测试过不少模型开发前端页面,很多都是基本不做移动端适配的。

然后我特意在移动端上看了下页面展示效果,没想到 K3 的适配效果也颇为完美。

实测三:全栈编程能力

不过此前 Kimi 的前端编码能力一直挺强,这次我想稍微上下难度,给网站新增一个「预测世界杯冠军」功能。

大家可以给自己心中看好的球队进行投票,并且能实时查看参与投票人数以及支持率。

这功能实现涉及改动前端界面、后端 API 接口、搭建数据库,防止刷票等复杂处理。

主要考验的是 K3 模型的全栈编程能力,以及是否能够持续长时间完成高难度的复杂开发任务。

在实现过程中,我意外地发现了它竟然能够调用工具自我测试,发现问题时主动修复。

这里可以看到, K3 的确能在没有人工的干预下,能连续长时间完成复杂的开发任务。

并且还会操作终端和各种开发工具,在代码和实时截图之间来回调试,自己看效果自己改。

最终实现的效果如下图,模型的审美依然在线。

左右是两大阵营的卡片信息。

img

里面有球队过往真实的比赛数据,以及可以给自己支持的球队进行投票。

投票完显示实时投票人数和支持率,也说明了已实现功能的前后端全栈逻辑。

写在最后

实测体验完 K3,给我的感觉相当不错,比预期的效果好不少。

前端审美从 K2.5 开始就没让我失望过,这次的决赛氛围改版,依旧在线。

另外在这几个实打实的实测开发场景里,我的感觉它能摸到 GPT-5.6 Sol 模型的水平。

当然它也不是没毛病,Kimi 官方也承认了 K3 存在一些缺陷。

比如模型有时会过于主动,需求没说细的地方,它可能就自作主张先干了。也坦言和 Fable 5、Sol 相比仍有差距。

不过这个差距,已经不再是当年那种,连国外顶级闭源模型车尾都看不到的鸿沟。

把时间拉长看,这个差距本身,就是一部追赶史。

过去三年,国产 AI 一直在回答同一个问题:

我们离世界最顶级的模型,到底还差多远?

从当年隔着一整个版本仰望 ChatGPT,到后面 DeepSeek 撕开一道口子,再到今天 K3 站上开源之巅。

这个问题的答案,从一开始的差几年,到现在变成了差半步。

在我看来,K3 不仅是 Kimi 的答卷,也是中国在这一轮人工智能浪潮中,交出的一份阶段性答卷。

———

本次 Kimi K3 API 的定价,其实与 Claude Sonnet 系列模型差不多。

相当于 K3 用 Sonnet 模型的价格,就能拥有比肩 Opus 4.8 的能力。

怪不得很多人在体验模型后,毫不犹豫就冲了 Coding Plan 套餐。

目前 Kimi K3 已在官网、App、Kimi Code 、Kimi Work 以及 API 开放平台全面上线,大家可以体验试试。

今天的分享到此结束,感谢大家抽空阅读,我们下期再见,Respect!

【声明】内容源于网络
0
0
GitHubDaily
专注于分享 GitHub 上知名的 Python、Java、Web、AI、数据分析等多个领域的优质学习资源、开源项目及开发者工具,为 GitHub 开发者提供优质编程资讯。
内容 1463
粉丝 0
GitHubDaily 专注于分享 GitHub 上知名的 Python、Java、Web、AI、数据分析等多个领域的优质学习资源、开源项目及开发者工具,为 GitHub 开发者提供优质编程资讯。
总阅读5.3k
粉丝0
内容1.5k