大数跨境

AI自己榨干算力!让Kimi K3自己写「超级算子」,推理快了3倍

AI自己榨干算力!让Kimi K3自己写「超级算子」,推理快了3倍 新智元
2026-09-30
7

Inferact与浪潮信息殊途同归:算子融合重塑大模型推理效率

大模型提速路径出现新突破。近期,vLLM原班人马创办的Inferact开源了TPU Megakernels(巨型算子),而国内浪潮信息则在AICC2026上发布了基于本土AI芯片的元脑SD200 Ultra超节点服务器。两者虽硬件平台不同,但核心思路一致:通过“算子融合”打破传统推理框架中的数据搬运瓶颈,显著提升Kimi K3等大模型的推理速度。

Inferact:TPU上的巨型算子实践

Inferact将Kimi K3的92个MoE层整合进同一个程序中,并在16颗谷歌TPU v7上运行。测试数据显示,开启投机解码后,单用户输出速度达到709 tokens/s;相比之下,同样使用16块英伟达GB200并采用vLLM框架,速度为452 tokens/s。即便关闭投机解码,在1到8的并发下,TPU方案的性能也是GB200的1.4到2倍。
值得注意的是,TPU v7的显存带宽(7380GB/s)低于GB200(8000GB/s)。Inferact的性能优势主要源于软件层面的优化。此外,这套巨型算子从零编译仅需不到90秒,远超以往同类大模型在TPU上动辄半小时的编译时间。

浪潮信息:本土芯片的系统级创新

同期,浪潮信息发布元脑SD200 Ultra超节点AI服务器,采用128芯本土AI芯片。在该平台上运行Kimi K3,Token生成时延低至5.85毫秒。其核心技术被称为“超级算子”,部分代码甚至由K3模型自身参与优化生成。

大模型推理瓶颈:从算力限制到内存墙

大模型推理速度慢的核心原因往往并非算力不足,而是数据搬运效率低下。模型每生成一个Token,需将参数从显存(HBM)加载至计算单元。传统推理框架中,生成一个Token需依次启动数千个细粒度算子,每个算子均经历“搬数据—计算—写回”的过程。
这种模式类似老式绿皮火车,每站停靠导致大量时间浪费在启停和数据切换上,造成显存带宽在算子间隙被闲置。尽管英伟达通过CUDA Graphs等技术优化了这一过程,但根本性的边界开销依然存在。算子融合技术旨在消除这些中间环节,实现“一站直达”。

技术路径解析:全量融合与模块化融合

Inferact:消除所有边界

Inferact采取极致的融合策略,将92层网络全部装入一个Kernel。程序根据层号自动判断执行KDA或MLA注意力机制。由于所有层在同一程序中,上一层计算时,下一层的权重已提前搬运至片上高速内存(VMEM)。TPU v7每个核心拥有64MiB VMEM,且由程序员完全控制,这为数据预取提供了硬件基础。相比之下,GPU片上内存分散且容量小,难以实现同等规模的数据驻留。
编译速度的提升源于工程师手工完成了原本由编译器自动执行的调度优化。Inferact表示,未来此类复杂Kernel的开发将更多交由编程智能体(Coding Agent)完成。

浪潮信息:系统级协同与AI辅助优化

浪潮信息的“超级算子”策略相对模块化,围绕KDA、Gated MLA、MoE等模块进行融合,使算子数量减少至原来的约十分之一。其优化分为三个层面:
  • 对称内存技术:实现显存统一编址,GPU可直接点对点访问远端显存,无需CPU中介。跨卡通信时延降至0.69微秒,AllReduce通信时间降低3.5倍。
  • 通算融合:通过Tile数据块组织流水线,利用异步搬运和多缓冲机制,实现数据搬运与计算同步进行,减少芯片等待空档。
  • AI自优化:构建“超级算子智能体”,让K3模型分析运行画像,自动生成候选算子方案,并通过“生成—验证—测量—迭代”闭环持续优化。最终使算子性能提升50%,综合推理效能提升3倍以上。
得益于3D Hyper Mesh架构和8TB统一编址显存,SD200 Ultra支持单机部署10万亿参数模型。在Kimi K3测试中,单用户吞吐突破170 tokens/s,达到业界平均水平的5倍。

行业趋势:从比拼算力到比拼系统效率

随着Agent应用的普及,推理时延和吞吐量成为影响用户体验的关键指标。Agent任务涉及多轮推理、工具调用和逻辑纠偏,对Token生成速度极为敏感。因此,客户关注点正从单纯的硬件参数(如卡数、峰值算力)转向实际模型运行效率。
当前,AI写算子已成为行业趋势。DeepSeek工程师刘胜指出,AI助手已能深入底层代码进行调优,预计半年至一年内AI编写的算子性能将超越人工。Cursor与英伟达的合作也证实,多智能体系统可在短时间内显著优化大量CUDA算子。
浪潮信息首席AI战略官刘军认为,针对具体模型进行芯片、系统、通信和算子的协同调优,是逼近系统极限的关键。新模型发布后,可利用智能体快速生成专属算子,形成“模型越强、算子越好、推理越快”的正向循环。
从Inferact的Megakernels到浪潮信息的超级算子,全球技术团队正通过消除数据搬运边界,提升有限算力下的智能产出效率。大模型竞争的下半场,将是系统级优化与AI自动化工程的较量。
【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16581
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读428.1k
粉丝0
内容16.6k