大数跨境

灵骏真武M890超节点实例 Day0 适配 Kimi K3

灵骏真武M890超节点实例 Day0 适配 Kimi K3 阿里技术
2026-07-28
15

7 月 27 日晚,阿里云灵骏真武 M890 超节点实例成功适配月之暗面 2.8 万亿参数大模型 Kimi K3。通过芯片、推理平台与模型的联合优化,实测首 Token 时延降低约 35%,显著提升了长上下文场景下的推理效率与用户体验。

Kimi K3:万亿参数模型的计算挑战

Kimi K3 是月之暗面(Moonshot AI)最新发布的旗舰模型,参数规模达 2.8 万亿,采用混合专家(MoE)架构,其完整权重已正式开放下载。作为业界参数规模最大的模型之一,Kimi K3 的高效运行不仅依赖大规模算力与显存,更需高速互联网络支撑数十张 GPU 的紧密协作。传统 AI 集群难以满足其高吞吐、低延迟及低成本的推理需求,官方推荐将其部署在"64 卡以上加速器组成的超节点”上。

灵骏真武 M890:专为万亿级 MoE 打造

灵骏真武超节点实例基于平头哥训推一体 AI 芯片真武 M890 构建。通过 ICN Switch 1.0 互联芯片,该实例可实现 64 张真武 M890 之间 800 GB/s 的 All-to-All 高速互联,显存总规模达 9TB。这一架构将万亿级 MoE 模型的 EP 专家并行通信流量限制在高带宽通信域内,有效保障了 Token 生成效率。

全栈协同:实现 Day0“开箱即跑”

为确保 Kimi K3 在真武 M890 上实现 Day0 高效运行,阿里云、平头哥与 Kimi 团队在算子及软件栈层面进行了深度联合适配。依托真武 AI 芯片的 T-Head SAIL 软件栈,Kimi 自研的 Mooncake 推理框架实现了快速部署。特别是在算子层面,真武 M890 对 Triton 的良好支持,使得大量基于 Triton 编写的自定义算子无需重写即可直接运行,大幅降低了适配工作量。

三大核心优化策略

针对 K3 超大规模 MoE 架构,三方团队实施了以下重点优化:

EP 专家并行通信优化
借助 ICN 64 高带宽通信域,对 MoE 核心的 All-to-All 专家路由通信进行深度调优,将 2.8 万亿参数的专家并行流量完全承载于单一超节点内部,避免跨节点通信成为性能瓶颈。

MXFP4 混合精度推理
结合真武 M890 原生支持的 MXFP4 低精度算力,在保证模型效果无损的前提下,大幅提升计算密度与显存利用效率。

KDA 混合架构算子深度优化
针对 Kimi K3 采用的 KDA(Kimi Delta Attention)线性注意力与全注意力混合架构,联合团队在真武 M890 上深度调优了核心算子。通过充分对齐芯片并行计算架构与访存特性,并利用算子融合减少 Kernel 启动与中间访存开销,显著提升了注意力计算的算力与带宽利用率。

实测性能显著提升

经过联合优化,Kimi K3 在灵骏真武 M890 超节点实例上不仅实现了 Day0 平稳运行,关键推理指标也获得可观提升(以下为阶段性优化实测经验值):

  • 相比迁移初期基线,首 Token 时延(TTFT)降低约 35%,长上下文场景体验更流畅;单卡解码吞吐(Decode Tokens/s)提升约 1.8 倍。
  • 借助 MXFP4 混合量化技术,整体推理效率得到进一步提升。
  • 得益于 KDA 线性注意力混合架构与算子优化,长序列推理算力开销随长度呈近线性增长,稳定支持最长 1M 上下文,从容应对长文档理解及复杂推理等场景。

此次 Day0 适配的成功,标志着阿里云、平头哥与 Kimi 团队完成了从芯片、推理框架到云平台的全栈协同。这不仅为 Kimi K3 等万亿参数大模型提供了开源开放的软件栈及国内可得的高算力选择,也为未来双方在模型适配、性能调优与工程化部署上的深化合作奠定了坚实基础,将持续提升 Kimi 系列模型在真武超节点上的推理性能与性价比。

【声明】内容源于网络
0
0
阿里技术
阿里技术官方号,阿里的硬核技术、前沿创新、开源项目都在这里。
内容 450
粉丝 1
阿里技术 阿里技术官方号,阿里的硬核技术、前沿创新、开源项目都在这里。
总阅读26.3k
粉丝1
内容450