
9月17日,华为在全联接大会2026上正式发布Peerium计算架构,提出将百万级处理器整合为“一台计算机”的系统级方案。同日,首代产品Atlas 950超节点25.6万卡集群已进入部署阶段,下一代Atlas 960系统正在测试中。这意味着AI算力竞争正从“单卡比拼”转向“系统级较量”。
传统架构为何撑不住了?
这要从计算机的“出厂设定”说起。冯·诺依曼体系结构要求计算机按程序顺序执行,主从关系贯穿其中。从ENIAC到当下最先进的计算机,几乎全部沿用这一架构。但在AI大模型时代,这个假设碰壁了。
数据显示,十万卡规模的AI集群,实际模型算力利用率仅约20%,大量算力处于等待通信完成的状态。换句话说,花了大价钱堆出来的集群,有八成算力在“空转”。集群规模越大,通信开销反而吞掉了更多有效算力。
过去几年行业拼命追求单卡性能提升,但真正卡住AI算力的,可能不是芯片本身,而是芯片之间“聊天”的效率。

华为给出了什么方案?
Peerium架构的核心是三件事:嵌套并行、统一内存寻址、全节点平等互联。其中最关键的是统一内存寻址,百万级处理器共享同一地址空间,任何一张卡都能像访问自己显存一样直接读写其他卡的数据,不用再经过网卡和交换机层层中转。
支撑这套架构落地的,是名为灵衢(UnifiedBus)的高速互联总线。它基于开放协议,可连接CPU、NPU、内存、SSD、网卡和交换机,实现计算、存储和网络的平等互联。技术参数上,灵衢将RTT通信时延从7微秒压缩至2微秒,互联带宽从百GB级提升至TB级。
同时,Peerium提出了Nested BSP编程模型,将并行计算任务分层递归组织,突破了传统图灵范式的顺序执行假设。
华为的解法能不能真正解决利用率问题?评论区聊聊你在实际部署中遇到的算力瓶颈。

产业链影响已经开始兑现
Atlas 950超节点是Peerium的首代商用产品。单柜64卡,最大可扩展至8192张NPU卡高速互联。更值得关注的是芯片迭代节奏:昇腾960芯片研发进度超出预期,960DT比原计划提前三个季度,将于2027年一季度就绪,2028年和2029年还将陆续推出昇腾970、980芯片。
华泰证券测算,2028年国产超节点市场空间有望达到3414亿元,2026年至2028年复合增长率约194%。超节点对时延、功耗、密度的要求全面抬升,交换芯片、光互联、液冷和高功率电源等环节同步受益。
从部署数据看,昇腾910C超节点已部署超1000套,昇腾950超节点也已进入规模商用阶段。2026年有望成为国产超节点放量元年,产业正从概念验证进入批量交付阶段。
与国际路线相比,差距在哪?
英伟达走的是NVLink封闭生态路线,将72颗GPU接入同一个算力域。华为的做法不同——把协议层统一为灵衢并对外开放,设备谱系从8卡一体机延伸到百万卡集群。东吴证券研报指出,英伟达NVLink凭借封闭生态长期构建技术壁垒,但随着AI集群向万卡级规模化演进,封闭垄断的弊端持续凸显。
不过,这场架构革命仍有待解课题:存量系统向灵衢迁移的成本与周期、百万卡集群对昇腾960等后续芯片按期就绪的依赖,以及Nested BSP编程模型能否获得足够的开发者生态支撑。
从产业格局看,一个趋势已经清晰: 中国AI算力正在走一条不依赖最先进制程、通过系统工程能力实现算力突破的路径。超节点路线的确立,意味着竞争重心从芯片制程转向互联协议、系统调度和生态开放度。
从产业格局看,一个趋势已经清晰: 中国AI算力正在走一条不依赖最先进制程、通过系统工程能力实现算力突破的路径。超节点路线的确立,意味着竞争重心从芯片制程转向互联协议、系统调度和生态开放度。
你的企业目前用的是传统集群还是超节点方案?迁移到新架构最大的顾虑是什么?
内容来源:网络
本期编辑:小艾
论文投稿:作为领先的高科技先进制造技术产业服务平台,AMT接受学术论文投稿;稿件的发布完全是公益和免费的;论文投稿邮箱:info@amtbbs.org
版权声明:AMT尊重版权并感谢每一位作者的辛苦付出与创作;除无法溯源的作品,我们均在文末备注了来源;如文章、视频、图片、文字涉及版权,请原创作者第一时间联系我们,我们将根据您提供的证明材料确认版权后立即删除内容或按国家规定标准支付稿酬!








