Inferact与浪潮信息殊途同归:算子融合重塑大模型推理效率
Inferact:TPU上的巨型算子实践
浪潮信息:本土芯片的系统级创新
大模型推理瓶颈:从算力限制到内存墙
技术路径解析:全量融合与模块化融合
Inferact:消除所有边界
浪潮信息:系统级协同与AI辅助优化
-
对称内存技术:实现显存统一编址,GPU可直接点对点访问远端显存,无需CPU中介。跨卡通信时延降至0.69微秒,AllReduce通信时间降低3.5倍。 -
通算融合:通过Tile数据块组织流水线,利用异步搬运和多缓冲机制,实现数据搬运与计算同步进行,减少芯片等待空档。 -
AI自优化:构建“超级算子智能体”,让K3模型分析运行画像,自动生成候选算子方案,并通过“生成—验证—测量—迭代”闭环持续优化。最终使算子性能提升50%,综合推理效能提升3倍以上。

