大数跨境

灵骏真武M890超节点实例 Day0 适配 Kimi K3

灵骏真武M890超节点实例 Day0 适配 Kimi K3 阿里云开发者
2026-07-28
2

阿里云灵骏真武 M890 超节点成功适配 Kimi K3 大模型

7 月 27 日晚,阿里云灵骏真武 M890 超节点实例宣布成功适配月之暗面(Moonshot AI)最新的旗舰模型 Kimi K3。该模型参数规模达 2.8 万亿,基于芯片、推理平台和模型的联合优化,实测首 Token 时延降低约 35%,显著提升了长上下文场景下的用户体验。

Kimi K3:万亿参数 MoE 架构的算力挑战

Kimi K3 采用混合专家(MoE)架构,是目前业界参数规模最大的模型之一,其完整权重已正式开放下载。高效运行此类模型不仅需要大规模算力和显存支撑,更依赖高速互联网络以实现数十张 GPU 的紧密协作。传统 AI 集群难以满足其高吞吐、低延迟及低成本的推理需求,月之暗面官方建议将其部署在由 64 卡以上加速器组成的超节点上。

灵骏真武 M890:高性能硬件底座

灵骏真武超节点实例基于平头哥训推一体 AI 芯片真武 M890 打造。通过 ICN Switch 1.0 互联芯片,该实例可实现 64 张真武 M890 之间 800 GB/s 的 All-to-All 高速互联,显存总规模达 9TB。这一架构能将万亿级 MoE 模型的 EP 专家并行通信流量限制在高带宽通信域内,有效保障 Token 生成效率。

全栈协同:从算子到软件栈的深度适配

为实现 Kimi K3 在真武 M890 上的"Day0"高效运行,阿里云、平头哥与 Kimi 团队进行了深度联合适配。依托真武 AI 芯片的 T-Head SAIL 软件栈,Kimi 自研的 Mooncake 推理框架实现了快速部署及“开箱即跑”。特别是在算子层面,真武 M890 对 Triton 的良好支持,使得大量基于 Triton 编写的自定义算子无需重写即可直接运行,大幅降低了适配工作量。

三大核心优化策略

针对 K3 超大规模 MoE 架构,三方团队实施了以下重点优化:

  • EP 专家并行通信优化:借助 ICN64 高带宽通信域,对 MoE 核心的 All-to-All 专家路由通信进行深度调优,将 2.8 万亿参数的专家并行流量完整承载于单一超节点内部,避免跨节点通信成为瓶颈。
  • MXFP4 混合精度推理:结合真武 M890 原生支持的 MXFP4 低精度算力,在保证模型效果无损的前提下,大幅提升计算密度与显存利用效率。
  • KDA 混合架构算子深度优化:针对 Kimi K3 采用的 KDA(Kimi Delta Attention)线性注意力与全注意力混合架构,联合团队深度调优了核心算子。通过充分对齐芯片并行计算架构与访存特性,并利用算子融合减少 Kernel 启动与中间访存开销,显著提升了注意力计算的算力与带宽利用效率。

实测性能显著提升

经过联合优化,Kimi K3 在灵骏真武 M890 超节点实例上不仅实现了平稳运行,关键推理指标也获得可观提升(以下为阶段性优化实测经验值):

  • 相比迁移初期基线,首 Token 时延(TTFT)降低约 35%,长上下文场景下体感更流畅;单卡解码吞吐(Decode Tokens/s)提升约 1.8 倍。
  • 借助 MXFP4 混合量化技术,整体推理效率得到进一步提升。
  • 得益于 KDA 线性注意力混合架构与算子优化,长序列推理算力开销随长度呈近线性增长,可稳定支持最长 1M 上下文,从容应对长文档理解、复杂推理等场景。

结语与展望

此次 Day0 适配的成功,标志着阿里云、平头哥与 Kimi 团队在芯片、推理框架到云平台的全栈协同上取得重要突破。这不仅为 Kimi K3 等万亿参数大模型提供了开源开放的软件栈及国内可获取的高算力选择,也为未来合作奠定了坚实基础。三方将继续在模型适配、性能调优与工程化部署上深化合作,持续提升 Kimi 系列模型在真武超节点上的推理性能与性价比。

【声明】内容源于网络
0
0
阿里云开发者
阿里巴巴官方技术号,关于阿里的技术创新均呈现于此。
内容 3826
粉丝 0
阿里云开发者 阿里巴巴官方技术号,关于阿里的技术创新均呈现于此。
总阅读90.8k
粉丝0
内容3.8k