Moonshot AI 正式推出其最新旗舰模型 Kimi K3,在 Artificial Analysis AI Index 上取得 57 分综合评分,智能水平与 GPT‑5.5、Claude Opus 4.8 相当,仅次于 GPT‑5.6 Sol 与 Claude Fable 5。
K3 拥有 2.8 万亿参数,一旦如期开源,将成为全球最大、性能最强的开放权重大模型。
评测结果:智能体能力跃升,已逼近全球商业最强模型
Kimi K3 在GDPval v2 智能体任务中获得 Elo 评分 1668,明显高于前代 K2.6 (1190),超越 GLM‑5.2 (1514)、GPT‑5.5 (1494) 和 Claude Opus 4.8 (1600),仅落后于 Claude Fable 5 (1760)。
在AutomationBench‑AA(基于 SaaS 工作流的智能体评测)中,其得分高达 53%,位列全球第一。
在长期知识与分析型任务的AA‑Briefcase Benchmark上,K3 获 Elo 评分 1547,较 K2.6 提升 +732 分,仅次于 Claude Fable 5。在执行、推理、结构化输出等维度,K3 已处顶级行列,仅在内容生成质量上略逊于 GPT‑5.6 Sol。
参数规模与架构:2.8T 参数重塑开源模型天花板
Kimi K3 搭载2.8 万亿参数,原生支持图像 + 文本多模态输入、上下文窗口100 万 token,是目前所有已知开源或拟开源模型中规模最大者。
若权重如期开放,Kimi K3 的 57 分综合评分将领先现有所有开源模型——
包括 GLM‑5.2(51 分)与 DeepSeek V4 Pro(44 分)。
商业化与成本:定价激进、效率显著提升
Moonshot AI 公布的 API 定价为:
推理单任务成本约 $0.94,与 GPT‑5.6 Sol 的 $1.04 接近,仅为 Claude Opus 4.8 ($1.8) 的一半。虽然高于 DeepSeek V4 Pro ($0.04),但在高端模型中已属成本竞争力最强之一。模型整体 token 效率提升 21%,即在更高得分下输出 token 减少,显示推理体系与压缩比优化成效显著。
功能亮点:自主智能体与“视觉闭环”特性
Moonshot AI 将 K3 定位为“自主软件工程智能体基座”。
模型可完成跨阶段长周期软件开发任务,在多步编程、调试与 API 操作中具备执行能力。
视觉闭环(Vision‑in‑the‑Loop)机制:
模型可截取屏幕、修改代码、检验输出结果,实现人机协作式开发。
在浏览器内构建 3D 开放世界游戏、完成 CAD 场景模拟、甚至用 WebGPU 仅凭自然语言实现 Game Boy Advance 模拟器和火箭仿真。
官方表示,这些能力使 K3 在可视化编程、交互设计、工业仿真等领域具明显领先优势。
生态与国际反响:从 DeepSeek R1 到 Kimi K3,中国模型体系进入“全球并行时代”
发布后,第三方机构将 K3 在前端任务榜单中排至 GPT‑5.6 Sol 和 Claude Fable 5 之上,
前白宫 AI 顾问 Sriram Krishnan 在 X 平台评论称:
“Kimi K3 或是全球 AI 模型竞赛中的第二个 DeepSeek 时刻。”
Moonshot AI 获得 Alibaba 战略投资。此次 K3 发布,引发国际舆论聚焦:
从性能看,已进入全球最强行列;从开放性看,2.8 T 参数的开源承诺将颠覆行业格局;从定价看,远低于西方对手,为开发者降低 AI 算力采购成本;从政策层看,也可能成为未来中美 AI 监管与技术出口争论的新焦点。
Saasverse Insights:K3 意味着什么?
从 GLM 到 DeepSeek 再到 K3,开源大模型首次在智能体任务中逼近顶级商用模型。
2️⃣中国 AI 模型生态完成从“模仿”到“体系创新”的转折
Moonshot 将 K3 明确定位于软件智能体,这是下一阶段 AI 商业化最具潜力的方向。
在 $15 / 百万 token 的输出成本下,全球开发者的 AI 算力门槛被进一步拉低。
4️⃣未来 6 个月窗口:开源权重、生态接入、API 合作三线共振
对于 VC 与企业而言,这是观测“新一代 AI 应用底层操作系统”的极佳周期。
我们相信:Moonshot Kimi K3 不仅是产品发布,更是中国 AI 模型走向全球竞速舞台中心的事件节点。
当 K3 权重开源的那一刻,全球 AI 生态的开放与专有边界,将被彻底改写。
End