
智东西 9 月 17 日上海报道,继华为监事会主席郭平提出"ICT 与计算的目标是成为‘英伟达’"的内部访谈后,华为在 2026 年全联接大会上正式释放算力“大招”。
会上,华为重磅发布灵衢互联架构及超节点集群方案,推出包括昇腾 960DT 芯片、昇腾 960 超节点、鲲鹏 950 超节点、OceanStor M900 记忆存储、灵衢全光交换设备在内的一系列 AI 基础设施新品,旨在构建智能世界的“硅基黑土地”。

华为副董事长、轮值董事长汪涛宣布,昇腾 960DT芯片研发进度超预期,预计将于2027 年一季度就绪。该芯片支持 2 PFLOPS(FP8)、4 PFLOPS(FP4)算力,性能较上代实现翻倍。依托“韬定律”,华为将坚持一年一代的演进节奏,计划于 2028 年和 2029 年陆续推出昇腾 970 和 980 芯片,持续实现算力性能翻倍。


在市场部署方面,汪涛透露昇腾 910C超节点已部署超过1000 套,昇腾 950超节点已开启规模商用。

本次发布的深层焦点在于灵衢 UnifiedBus,这是华为算力底座的统一互联总线协议。华为常务董事、ICT BG CEO 杨超斌指出,基于该协议的单集群可支持100 万颗AI 处理器,10 万卡集群的模型浮点算力利用率(MFU)从 20% 显著提升至35%。

汪涛强调,强大的 AI 基础设施是智能世界的坚实底座。华为坚持聚焦打造“硅基黑土地”,确立了包括“硬件变现”、“超节点 + 集群”在内的七大战略,旨在打造中国坚实的算力底座。

生态建设方面,华为昇腾已跨越生态拐点。CANN 社区月活开发者突破 5000 名,外部开发者占比达 61%,首次超越内部开发者。同时,华为鲲鹏生态全球开发者超416 万,支持 560 多个全球开源项目;openEuler(开源欧拉)装机量超2000 万套,位居中国服务器操作系统份额第一。

01. 打破 10 万卡集群通信墙:华为憋了一年的大招来了
随着大模型迈向 10T 级参数规模,超节点成为 AI 基础设施建设的必然选择。汪涛指出,10 万卡算力集群虽将成为训练 SOTA 模型的标准配置,但面临大规模跨节点通信开销巨大、MFU 提升困难等挑战。


为优化计算系统架构,华为提出超节点设计理念:通过一套协议平等连接超节点内所有组件,支持跨物理服务器的统一内存编址,并采用“近铜远光”互联方式,使数万颗芯片间的通信具备近乎线性的带宽与时延,从而像一台计算机一样高效工作。

这一理念的核心是去年 HC 大会上推出的灵衢 UnifiedBus。该技术规范已全面开放,今日以之为核心的全新超节点“全家桶”正式登场。
02. 灵衢一统、11 芯撑起、昇腾 960 面世:华为超节点冲向百万卡
汪涛表示,基于灵衢 UnifiedBus,华为已打造超节点和超节点集群所需的 11 颗关键芯片。
1. 11 颗芯片撑起超节点,昇腾 960DT 来了
昇腾芯片是系统中的核心部件。汪涛现场宣布推出昇腾 960DT芯片,其支持 2 PFLOPS(FP8)、4 PFLOPS(FP4)算力,片上 HBM 最大支持 288GB,带宽达 9.6TB/s,性能实现翻倍。该芯片比原计划提前三个季度,预计 2027 年一季度就绪。


此外,昇腾 960PR将进一步支持 8 PFLOPS 的 FP4 算力,预计 2027 年三季度就绪。未来,华为将依循“韬定律”,在 2028 年和 2029 年推出昇腾 970 和 980 芯片,持续提升算力规格、仿真带宽及互联带宽。


汪涛展示了支撑超节点集群的 11 颗关键芯片,涵盖四类:
- 计算类芯片:包括鲲鹏 CPU、昇腾 NPU,承担核心计算功能。
- 互联类芯片:包含 Scale-out 大容量交换芯片、Scale-up 低时延交换芯片及高速光互联芯片。
- 存储类芯片:除介质控制器外,专为 AI KV Cache 打造 Smart Storage Unit,实现一跳直达缓存。
- 管理类套片:负责复杂系统的协调与管理。

2. 推出业界首个量产 NPO,昇腾 960 超节点冲上 4096 卡
为突破电互联限制,华为宣布推出业界首个量产 NPO(近封装光学)光引擎——Hi-ONE。该产品传输能力达 7.2Tbps,是目前行业最大且唯一内置光源的 NPO 产品,集高带宽、高可靠、低时延和低功耗于一体。


基于此,华为推出业界首个采用 NPO 的昇腾 960 超节点。单个超节点可实现4096 卡规模,提供 8 EFLOPS FP8 算力及 1PB HBM 容量,系统可用度达 99.8%。风冷与液冷版本将分别于 2027 年 Q2 和 Q3 上市。

3. 鲲鹏超节点:4096 节点、256TB 统一内存池,Agent 启动快 30 倍
针对海量 Agent 并发需求,华为升级鲲鹏超节点。通过将多台通用服务器内存形成统一共享内存池,显著提升 Agent 沙箱启动速度及向量检索性能。
新版鲲鹏超节点基于灵衢架构,最大支持4096 节点,形成高达256TB的统一内存池。实测显示,10 万级沙箱启动速度较传统方案提升30 倍,沙箱密度提升 25%;复杂向量检索效率倍增,达到 30 万 TPS。

4. 推出 AI 记忆存储方案,KV Cache 时延降超 50%
华为基于灵衢打造AI 记忆存储 OceanStor M900,支持直连 L3.5 层 PB 级 KV Cache 解决方案。相比业界通用的 PCIe+RoCE 方案需 5 次数据搬运,OceanStor M900 仅需 1 次,I/O 时延和首 token 时延降低超50%,同时 SSD 读写寿命提升 16 倍。



▲OceanStor M900 液冷节点
5. 灵衢 + 二层 CLOS 组网,华为打造 100 万卡超大规模集群
基于灵衢 UnifiedBus 与二层 CLOS 灵活组网,华为构建了支持100 万卡的超大规模集群。通过多平面组网,最大集群规模可达 51.2 万张昇腾 960 卡。

该超节点集群具备三大特征:统一灵衢协议减少转换开销;昇腾超节点、鲲鹏超节点及 KV Cache 子系统对等互联;多层次存储系统满足各类 KV Cache 一跳直达需求,最大化资源利用效率。

03. 四大举措推进 AI 入端、上车、进家,构筑新一代通信网络
未来 AI 将重构终端与人机关系,端侧模型参数预计在 2026 至 2030 年间实现 10 倍跃迁,算力从 20-80 Tops 提升至 180-200 Tops。华为将从四方面构建能力:
- 算力自给:通过“麒麟 + 昇腾”组合实现端侧算力自主。
- 端侧智能:结合“盘古 + 三方大模型”,已在 Mate X2 非凡大师上商用原生盘古 MoE 全国产大模型。
- 系统重构:HarmonyOS 将进化为 Agent OS,支撑 Agent 与人共生共用。
- 生态繁荣:依托丰富的 AI 生态及鸿蒙智能体框架,全面开放 AI 接入能力。

华为将围绕手机、AI PC、车和家庭打造四大端侧算力平台,构筑分布式群体智能。目前开源鸿蒙生态规模已超 13 亿。


在“用算”层面,华为提出构筑新一代通信网络,融合 5G/6G 及万兆光网技术,保障智能触达每一个人、家庭和企业。

04. 华为鲲鹏开发者超 416 万,昇腾跨越生态拐点
构建开源开放的算力生态是华为核心战略。数据显示,华为鲲鹏生态全球开发者超416 万,合作伙伴超 7200 家;openEuler 装机量超 2000 万套,居中国服务器操作系统首位。
昇腾生态已跨越拐点,CANN 成为中国最活跃 AI 开源社区,外部开发者占比 61%,原生训练模型超 40 个。昇腾已覆盖 90 多个主流三方社区,成为继英伟达、AMD 和英特尔后,PyTorch 官网可直接安装的算力平台。

面对多样化的算力需求,华为将通过算力基础设施和云服务两套核心能力,提供灵活的算力供给模式。

05. 结语:灵衢破墙,华为重做 Agent 时代算力底座
从灵衢打破通信墙,到 11 颗芯片撑起超节点,再到百万卡集群与开源生态的跨越,华为正以“计算 + 通信”的垂直整合能力,为 10 万亿级大模型时代构筑坚实底座。当竞争升维至体系化能力较量,华为的“硅基黑土地”正为智能世界提供新的选择。






