大数跨境

通信墙不破,AI Agent算力不立!华为超节点“黑科技”详解

通信墙不破,AI Agent算力不立!华为超节点“黑科技”详解 智东西
2026-09-19
15
导读:10万卡算力利用率大涨15%!神秘的华为“灵衢”有什么过人之处?

10 万卡算力利用率大涨 15%!揭秘华为“灵衢”架构核心优势
作者 |  李水青
编辑 |  漠影
智东西 9 月 19 日报道,在 9 月 17 日 -19 日举办的华为 2026 年全联接大会上,华为围绕灵衢互联架构及超节点集群,推出昇腾 960 芯片、昇腾 960 超节点、OceanStor M900 AI 记忆存储等一系列 AI 基础设施新品。其中,“灵衢”作为贯穿所有发布的高频关键词,成为产业关注焦点。
华为常务董事、ICT BG CEO 杨超斌在演讲中揭示,灵衢(UnifiedBus)是华为算力底座的统一互联总线协议。它将 CPU、NPU、DPU、DDR、SSD 等多种计算与存储单元统一互联,贯穿单机、超节点至超大规模集群。数据显示,基于灵衢的 10 万卡集群模型浮点算力利用率(MFU)从传统的 20% 提升至35%,有效应对 AI Agent 时代的计算需求。

通信成 AI Agent 算力胜负手:三大挑战逼出灵衢架构

AI Agent 时代,模型参数规模迈向 10 万亿级甚至 50 万亿级,上下文长度达几十 M 级,人与 Agent 交互频次激增。计算系统面临超大模型推理、高频调用及多层级信息传递等挑战,通信能力成为决定算力效率的关键。

1. 通信量平方级暴涨,突破 MFU 瓶颈

数据并行域内通信量与参数量呈近似平方关系,导致不可掩盖的通信时间占比倍增,MFU 快速下降。典型 MoE 模型在 10 万卡集群上的 MFU 不足 20%,打破此趋势成为首要难关。

2. 异构协同与内存池化成刚需

AI 业务负载多样化,Prefill 与 Decode 呈现不同计算与访存特征,需 P、D 分离及专用算力加速。随着 Agent 应用普及,系统需实现 CPU 与 NPU 的异构协同及内存资源池化,以动态高效调整资源配置。

3. 上下文变长催生多级缓存架构

训练与推理需构建 HBM、DDR、SSD 分层分级缓存架构。现有 PCIe 加 RoCE 网络难以满足 PB 级 KV Cache 所需的低时延与大带宽,通信效率成为系统性能瓶颈。

一套协议打通芯片到集群:灵衢四大核心竞争力

灵衢通过一套协议贯穿从芯片到集群的全系统,实现复杂协议归一与统一内存语义,消除协议转换开销。其核心竞争力体现在四个维度:

1. 协议归一,统一内存语义

灵衢将 CPU、NPU、DPU、内存、存储等核心组件基于统一协议互联,实现十几种协议归一及超节点内部全局内存统一编址。此举将互联带宽从百 GB 级提升至 TB 级,RTT 通信时延从 7 微秒压缩至 2 微秒,降低约 70%。

2. 多样算力,异构协同

计算与存储单元通过灵衢直接对等互联,形成去中心化平等访问方式。系统可根据业务需求灵活配比 CPU 和 NPU,具备高度可扩展性,不再受制于固定节点结构。

3. 分级存储,全局池化

针对单芯片内存容量瓶颈,灵衢通过分级存储和全局池化,将多种混合介质纳入统一资源体系,显著提升内存利用率。

4. 光电互联,灵活组网

华为通过光电互联构建超高带宽、超低时延的“数据高速公路”,突破电互联物理限制。以 4096 卡超节点为例,灵衢最长传输距离超 200 米,支持单个集群扩展至 100 万颗 AI 处理器。

从单柜到百万卡:全场景覆盖满足各类 Agent 需求

基于灵衢,华为构建了光电互联、多样算力、分级池化的 AI Agent 超节点集群,产品全面支持模块化设计与灵活配置。

1. 支撑超节点“全家桶”,昇腾 960 提升计算效率

新发布的 Agentic AI 超节点集群由鲲鹏 950 超节点、昇腾 960 超节点、OceanStor M900 记忆存储及星河 UBG 交换机组成。单个昇腾 960 超节点可实现 4096 卡规模,提供 8 EFLOPS FP8 算力及 1PB HBM 容量,系统可用度达 99.8%。风冷与液冷超节点计划于 2027 年上市。

2. 从单柜 172T 到百万卡:分层按需弹性扩展

在 Scale-Up 方向,柜内灵衢交换刀片支持 172T 带宽,单柜可节省大量铜缆。跨柜后,灵衢交换设备实现 280T 全光互联,RTT 时延低至 2 微秒。向 Scale-Out 扩展,UBG 灵衢网络交换机支持百万卡超节点集群,适配几十万亿参数模型演进。

3. 算力存储三件套融合,实现 1+1+1>3

鲲鹏 950 超节点支持超过 150 万核统一调度及 24000TB 内存全局池化;昇腾 960 超节点提供 32 PFLOPS FP4 算力及 17.9TB/s 互联带宽;OceanStor M900 实现“三芯合一”,单节点访问带宽达 480GB/s。三类硬件通过灵衢统一协议联动,实现高效协同。

4. 灵衢下沉一体机:本地运行万亿模型

针对中小场景,华为推出系列化一体机产品。Atlas 650E 支持双机灵衢直连,16 个 NPU 进行 Full-Mesh 组网,无需交换机即可支持万亿参数模型,推理吞吐提升 40% 以上,时延低至 10 毫秒,保障中小企业本地部署的数据安全与体验。

开源组件加行业算子库:打造“开箱即用”生态

华为 CANN 已跃升为中国开源项目活跃度第一,月活开发者超 5200 人。联合 50 多家头部客户及高校,华为打造了 26 个行业专属算子库,涵盖电力仿真、负荷预测等场景,推动 AI 落地生产一线。
在 Agent 开发生态方面,华为与 DeepSeek Harness、OpenCode 等开源框架协同,打造插件化组件并全量开源。通过与 90 多家主流开源社区合作,覆盖算子编程、模型训练微调及推理部署全链路,降低开发门槛,实现“开箱即用”。

结语:算力底座之争,华为给出系统级新选择

面对 AI 时代变革,华为坚持系统级技术创新与开源开放战略。从灵衢打破通信墙,到 11 颗关键芯片撑起超节点,再到百万卡集群与开源生态的跨越,华为正以“计算加通信”的垂直整合能力,为 10 万亿级大模型时代构筑坚实算力底座,为世界提供新的选择。
【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11841
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读244.5k
粉丝0
内容11.8k