作者丨 Rhea
编辑丨马晓宁 李娜
在动漫历史中,除了樱桃小丸子,还有一颗闻名世界的“大丸子”:螺旋丸。这是混乱与秩序极限对抗并形成最佳平衡的存在,也是其美感根本来源。用工程师的第一性原理来说:约束才是威力的本源。能量的破坏力不取决于总量,而取决于密度,密度则来自于约束。
在深度体验 Kimi K3 的各项能力后,最想分享的正是这颗“丸子”。无论是前端呈现效果、代码层深度,还是日志分析中的亮点,都可以肯定地说:K3 就是一颗不靠血脉,纯靠控制精度,硬生生搓到世界第一梯队的螺旋丸。
开源 2.8T:人少卡少的代价与门槛
凝聚:“气流在分散状态只会是轻抚的微风,只有把力量集中在单点才能完成质的转变。”
Moonshot 目前估值约 200 亿美元,半年融资 39 亿美元,核心团队约 80 人。面对 OpenAI、Anthropic、Google 等巨头,其在资金和算力上存在量级差距。且在 K3 官方 benchmark 中,部分测试使用的是性能受限的英伟达H20芯片。
卡更少、钱更少、人更少,但他们做出了第一个开源的 2.8T 级模型。
此前,该体量模型仅存在于少数公司内部。闭源巨擘从不公开权重,开源阵营最大一直停留在 1T 档位。K3 首次将闭源级别的体量摆上桌面——研究者可拆解分析,开发者可蒸馏、微调、做产品,无需申请或付费。这是为整个行业节省的成本与时间。
然而,开源并不意味着低门槛。K3 的官方部署建议是64 张以上加速卡组成的 supernode。API 定价为输入 3 美元、输出 15 美元每百万 token,相比前作 K2.7,输出价格涨幅近四倍。在资源不占优的情况下,Moonshot 选择将有限资源全部押注于能力上限,并诚实地说明了跑满血版的成本与代价。
KDA / AttnRes:两项提前开源的技术底牌
“当资源被聚集,团队变专注之后,让一切可以永动的资源以合理的方式高速转动起来就是进一步提升力量的秘诀。而且转法决定一切。”
K3 最受关注的数字是 2.8 万亿参数,但其真正的技术内核在于改变组织方式,而非增加规模。
KDA(Kimi Delta Attention):以限制换效率
传统注意力机制中,上下文越长,成本呈指数级增长。KDA 的做法是主动做限制:大部分时候不回头翻原文,只看一页摘要。关键在于这页摘要永远只有一页,读完一段即更新,成本不再随长度线性增长。架构采用三层线性注意力混合一层全注意力的 3:1 策略。
代价是四分之三的层无法看到原文,只能依赖摘要。但换来的是:在 48B 验证模型上,KV cache 最多降低 75%,100 万 token 长度下解码速度快 6 倍。这就是"1M 上下文能真跑起来”的原因——不是靠堆资源,而是靠厘清哪些层根本不需要看全文。
(Kimi Delta Attention 论文摘要)
AttnRes(注意力残差):让连接方式可学习
Transformer 中的残差连接标准做法是将每一层输出用固定权重累加,这会导致隐状态幅度无限增长及关键信息被稀释。AttnRes 的改法是给每一层配一个自己的“编辑”:它不照抄前人,而是自行判断从哪几层调取信息。这种判断是训练出来的,意味着连接方式本身从死规定变成了可学习和进化的本领。
效果立竿见影:在 1.4T token 的训练上,它追平了一个多用 1.25 倍算力的基线。这就是官方宣称“训练效率提升约 25%"的真实原理——同样的结果,少烧四分之一的算力。
(ATTENTION RESIDUALS 论文片段)
值得注意的是,K3 的技术灵魂恰恰是反参数竞赛的。其两个核心创新,一个省推理,一个省训练,均是用更聪明的结构换能力。且这两项技术在 K3 发布前八九个月就已分别开源,并在 48B 小模型上验证过效果。先小规模验证架构,再放大到旗舰,体现了极强的资源调配能力与战略定力。
(hugging face 上 kimi 48B 的验证模型)
量化与减法:模型和前端的共同逻辑
仅仅是把资源旋转起来还不够。还得极度聚焦或者说专注。
威力来自密度,密度来自约束。K3 架构中处处体现这一逻辑:2.8 万亿参数,但每次只激活 896 个专家中的 16 个;从后训练阶段就开始采用 MXFP4 权重、MXFP8 激活做量化感知训练。它是一开始就在被压的状态下训练。
在前端项目开发过程中,共有 6 个版本是主动往回删减效果的。球体进化形态的微调中,体积极限提升的同时,最外层的壳被减薄。外部装饰一直在删,内部分层一直在加深。
(只改动螺旋丸最外层的发光壳时,agent 整个思考过程)
(去除火舌时 agent 的思考过程)
执行减法而不崩坏内核
第一,执行减法时未破坏内核。删除白闪、光圈、减薄壳层等操作涉及复杂的渲染管线,改错一处便可能连带崩溃。K3 连续六次修改均未出错,展现了极高的代码鲁棒性。
第二,方案符合人类审美。在放大形态的微调中,K3 给出的方案是“加内部层次、减外部厚度”。不同于 AI 生成常见的堆砌特效,K3 选择让球体外涨、内核内收、外壳变薄,这已符合人类的审美与感知逻辑。
前端实测:螺旋吸入与同一力场
前端能力的困境与突破
视觉效果的实现历经 Flash、CSS 动画到 Canvas/WebGL 时代。CSS 擅长插值但缺乏物理感知,Canvas 虽全能但需手写所有逻辑。最大的难点在于一致性:让粒子、叶子、文字等元素受同一个力场支配,而非各自为政。
零外部 JavaScript 依赖,所有特效均似手写 Canvas 2D。
最难的前端效果:文字吸入
搓球时,页面上所有文字、按钮、导航栏均需被吸进球里。K3 并未采用简单的淡出加粒子欺骗视觉,而是实现了真实的物理吸入。
第一步,自动拆分文本。利用 TreeWalker 遍历文本节点,将每个字包进独立 span,并特意跳过日文注音标签<rt>。
第二步,递归半平面切割。将每个字切成随机碎片,生成无缝铺满、互不重叠的随机多边形,再用 CSS clip-path 落到 DOM 上。
(index.html 第 1199–1230 行)
第三步,隐性难点处理。针对斜排拟音词,K3 自动计算祖先元素的 CSS matrix 旋转角并反向补偿,确保克隆碎片字形不歪。这是需求未提及但实现中暴露的隐性难点。
所有东西活在同一个力场里
文字碎片、树叶、气流、尘埃共用同一套流场公式。环量项决定绕球速度,径向汇流项决定吸入速度,均随距离衰减。个体拥有独立系数,呈现出真实的物理差异。碎片飞行时还会沿运动方向拉伸,实现专业的运动模糊效果。
( index.html 第 1355 行(碎片))
(index.html 第 1704 行(树叶))
架构设计的精彩之处
K3 展现了优秀的工程思维。先是进行“涡旋气流物理化重构”,将视觉模拟改为速度场驱动;次日在此基础上顺势实现文字吸入功能。架构决策在前,视觉效果在后,确保了所有元素能共用同一套流场。
内容区一次成型
页面中 234 行纯内容区无一行 Canvas 代码,却几乎还原了 Jump 官网水平。六个章节均由 K3 自主规划,顺序逻辑清晰。
以下是逐页展示:
多轮对话:思考过程能不能丢掉?
产品层:持续供能的状态
官方文档警告:多轮对话和工具调用时,必须原样传回包含 reasoning_content 的完整 assistant message,否则质量可能剧烈波动。K3 不是一个静态问答工具,而是一个需要持续供能维持的状态。一旦丢弃思考历史,效果便会消散。
针对 Terminal-Bench 2.1 测试中 Moonshot 官方成绩(88.3)与第三方重测成绩(85.0)的差异,推测并非模型能力问题,而是不同脚手架对思考历史的处理方式不同所致。评估 K3 时,应将“模型能力”与“脚手架适配”分开考量。
工程层:完整的状态机
项目实现了完整的三状态机——静止、吸入中、归位中。松手后,碎片飞回原位淡出,变形元素弹性回弹,被吞元素重新聚合。系统可无限次进入退出,不留残渣。
此外,针对长按按钮被吸入后无法接收松手事件的问题,K3 采用透明度归零而非隐藏的方式处理,确保按钮不可见但仍能响应鼠标事件。
26 次迭代里的真实问题
该项目并非一蹴而就,共迭代 26 个版本,期间也暴露了具体问题:
1M 上下文被撑满。导致会话中断或早期记录被压缩,证明在长程工程中 1M 仍显不足。
会犯低级错误。如裁切人物头像位置错误,需依靠生成参考图修正。
存在小 Bug。导航栏 tooltip 文案出现日中混排,因隐蔽未被及时发现。
成本高。两天即用尽基础订阅额度,项目总成本约 19 美元。
这份产物是人类协作与反复迭代的结果,证明了 K3 在有人引导下的能力上限。
混乱与秩序的极限美学
约束才是威力的本源,密度来自被秩序化的程度。K3 在前端能力上的表现令人惊艳,其作品天花板正越来越靠近使用者的想象力。
关键在于用户是否想清楚自己追求的是什么。本次二十多轮迭代中,提示词简单甚至粗糙,但 K3 能很好地理解并执行,带来诸多惊喜。
(该项目所有发出去的提示词合集)
做完这个网页后,越发体会到:AI 的威力不取决于手里有多少能量,而取决于如何控制它。这句话对模型的工程思路成立,对使用者亦然。
项目链接欢迎体验:https://chaos-naruto.kimi.page/index.html(彩蛋:按数字 123 可切换螺旋丸状态)


