技术与商业的双重底色。
作者:孙欣
来源:中国企业家杂志(ID:iceo-com-cn)
7 月 16 日晚,在世界人工智能大会(WAIC)开幕前夕,月之暗面突然发布 K3 模型。作为全球首款万亿级开源大模型,K3 拥有 2.8 万亿参数及 100 万 Token 上下文窗口,多项测评得分超越 GPT-5.6 等海外顶尖模型,被业内视为国内断层式领先的产品。
K3 的定价策略同样引发关注:输入 20 元/百万 Token、输出 100 元/百万 Token,位列国产模型最高档。高盛研报指出,这标志着中国模型走向定价权的全新节点。马斯克随后在社交平台点赞并喊话竞品,月之暗面方面则坦然回应期待竞争。
K3 的发布剧烈搅动了资本市场。美股四大科技巨头股价走低,港股智谱、MiniMax 等竞争对手股价大幅调整。与此同时,创始人杨植麟及其导师 Russ Salakhutdinov 的过往经历成为舆论焦点,Russ 高度评价杨植麟是兼具顶尖科研能力与商业头脑的罕见人才。
尽管 K3 实力获认可,但其高昂的调用成本与算力压力也引发争议。面对需求激增导致的算力瓶颈,Kimi 暂时对新用户关闭订阅。然而,资本市场对月之暗面的估值预期持续走高,据悉其计划启动新一轮融资,目标投前估值高达 500 亿美元。
为长程复杂任务而生
K3 的核心突破在于将对话式 AI 推向项目式 AI。测试显示,其在 Web 开发场景中的代码一次通过率显著优于竞品,前端生成质量可直接上线。多模态能力方面,K3 在 BrowseComp 基准测试中以 91.2% 的成绩拿下 SOTA,能够整合文本、图像与代码交付完整产品。
技术层面,K3 依托自创的 KDA 混合线性注意力机制及注意力残差架构,实现了精度与成本的平衡。该架构允许模型在关键节点采用全注意力计算,非关键路径切换为线性注意力,使百万上下文解码速度提升 6.3 倍,训练效率提升约 25%。
从 K2 到 K3,Kimi 始终聚焦于解决长任务链条中的推理稳定性问题。黄震昕强调,K3 的性能跃升源于底层原创架构创新,而非蒸馏小模型。针对开源策略,尽管存在“减速主义”的质疑,但导师 Russ 认为开源虽让出短期优势,却有助于生态通过蒸馏优化降低长期 Token 消耗,是更具远见的选择。
“天才”杨植麟:技术与商业的双重底色
K3 的成功让外界重新审视杨植麟的成长轨迹。其导师 Russ 用“才华横溢、极其勤奋、谦逊”形容他。杨植麟本硕毕业于清华,博士就读于卡内基梅隆大学(CMU),期间在 Google Brain 实习并参与底层系统优化,展现出极强的自主性与执行力。
清华时期,杨植麟专业课成绩优异,大二即加入实验室核心,提出的优化算法被多家巨头采用;大三时凭借癌症预测算法在全球大赛中击败斯坦福等名校团队。截至目前,其论文引用量已超 2 万次。
除了技术天赋,杨植麟的商业敏锐度同样出众。他不仅善于沟通,更具备独特的号召力,能从高校实验室成建制地引进人才。Russ 评价道,杨植麟罕见地将技术领军能力与商业节奏把控完美结合,这是月之暗面在人才大战中保持领先的关键。
国产 AI 拿回定价权
K3 的高定价策略引发了关于“能力定价”还是“低价竞争”的讨论。由于模型庞大,运行 K3 所需的算力成本远高于同类国产模型。上线初期,因用户需求逼近 GPU 容量极限,Kimi 紧急重构会员体系,优先保障付费用户体验,甚至暂时限制新用户注册。
业内人士分析,K3 的定价释放了新信号:模型竞争正从单纯的价格战转向价值战。虽然单价较高,但其在复杂任务中更低的返工率和更少的交互轮次,可能使综合成本更具优势。此外,相较于海外头部模型,K3 的价格仍具竞争力,显示出月之暗面瞄准全球市场的野心。
商业化方面,Kimi 现阶段聚焦 API 业务,暂不提供私有化部署。未来,Kimi 计划构建分层模型体系,通过大小模型搭配满足不同效率需求。黄震昕表示,参数规模的拓展不会止步,当前的价格争论仅是更大故事的开端。

