数字世界的算力“普通话”
核心导读
■
华为昇腾 950 超节点真机在 2026 WAIC 首次亮相,凭借 1024 卡规模与统一内存编址技术引发关注。
■
超节点通过灵衢互联协议实现跨物理节点统一内存编址,以系统级协同效率突破单芯片物理极限。
■
华为开放灵衢协议与基础软件生态,推动国产算力从单点突破走向行业标准,构建自主可控的算力底座。
作者 | 曹全景
编辑 | 高珮莙
7 月 17 日,2026 世界人工智能大会(WAIC)在上海开幕,“超节点”成为行业焦点。中兴通讯、沐曦股份、壁科技等企业纷纷展示相关真机,标志着 AI 算力基础设施新一轮竞争正式开启。
其中,华为展台备受瞩目。首次公开亮相的昇腾 950 超节点(Atlas 950 SuperPoD)真机,以业界最大的 1024 卡规模、256TB 内存统一编址,以及 1 EFLOPS FP8、2 EFLOPS FP4 的强劲算力,吸引众多参会者驻足。
华为技术人员指出,超节点与传统集群的本质区别在于:它通过高速互联实现不同服务器间的统一内存编址与共享内存池,逻辑上等同于“一台超级计算机”,而非简单的物理堆叠。
7 月 19 日,鹏城实验室和 GCC 联合发布《超节点定义与实践白皮书》,明确界定:超节点是具备跨物理节点统一内存编址能力的计算系统。这一架构特征的确认,意味着中国 AI 产业竞争已从单芯片性能比拼,全面转向系统级协同效率的较量。
用数学“补”物理
在国泰海通证券营业部,数百名研究员需从海量数据中筛选价值信息。面对金融行业对高可靠、低时延及数据安全的严苛要求,传统单机或双机部署已难以应对。
7 月 15 日,国泰海通与华为合作部署了金融行业首个 AI 液冷超节点。相比上一代 Atlas 900 A2 集群,昇腾 Atlas 900 A3 超节点将单次交互 TTFT 时延从 10 秒缩减至 2.8 秒,单卡端到端推理吞吐提升 3.2 倍,研报产出及服务效率提升 5 至 10 倍。
当前,智能体爆发与 Token 经济时代已然到来。国家数据局数据显示,全国日均 Token 消耗量两年间增长超千倍。据 CIC 灼识咨询推算,中国智能计算芯片市场收入预计将以 46.3% 的复合年增长率持续扩张,显著高于全球平均水平。
然而,国产算力面临结构性困境。在摩尔定律驱动下,英伟达先进芯片已达 3 纳米工艺,算力领先国内两代。短期内制程追赶困难,成为国产 AI 芯片的痛点。
昇腾 950 超节点的破局逻辑在于:放弃单颗芯片的“单挑”,转而用数百甚至上千颗芯片组成逻辑统一的超级计算机,以系统级能力弥补单点差距。正如华为技术人员所言,这是“用数学的方式突破物理的限制”,实现换道超车。
作为目前国内唯一规模商用的超节点方案,昇腾 384 超节点已在互联网、金融、医疗等 20 多个行业商用 750 多套,适配 DeepSeek、Kimi 等 65+ 主流大模型。其应用成效显著:
- 科研领域:上海人工智能实验室基于昇腾 Atlas 900 A3 SuperPoD 完成万亿参数科学多模态大模型全流程研发。
- 软件开发:深信服合作的企业级 AI 代码开发,人均产出提升 4 倍,严重 BUG 检出率质量提升 1 至 2 倍。
- 金融服务:浦发银行部署后,理财推荐命中率从 2% 提升至 9.9%,风控模型查准率从 2.6% 提升至 16%。
- 工业制造:宝武钢铁利用该技术预测高炉炉温,单高炉年增效益超千万;钢材成材率提升 0.5%,单产线年节省超 9000 万元。
数字世界的算力“普通话”
将数千张加速卡连接并非难事,难点在于打破传统架构限制,消除服务器间通信瓶颈。传统集群依赖 PCIe 或以太网,跨服务器带宽有限且时延较高,在千亿参数模型训练中易成为性能瓶颈。
昇腾超节点通过精密的灵衢互联协议,实现了跨物理节点的统一内存编址。技术人员比喻:若集群是一座城市,传统架构下各楼栋独立运转,通行需绕行且受红绿灯限制;而灵衢如同修建了一条贯穿所有房间的高速公路,实现 CPU、NPU/GPU 间的直接互联与全局内存管理。
灵衢协议的核心突破在于协议归一。传统数据中心中,CPU、GPU 及跨服务器通信使用不同“方言”(如 PCIe、NVLink、RoCE),交互需反复翻译导致时延损耗。灵衢定义了一套覆盖全设备的统一协议栈,让所有算力部件使用通用的“普通话”交流,消除了协议转换开销。
超大带宽、超低时延、统一内存编址三大能力协同,是区分真假超节点的基准线。昇腾 950 超节点拥有业界最大 1024 卡规模及 256TB 统一编址内存,关键指标提升至少 70%,跨节点通信时延降至 3 微秒,平均稳定运行时长达 300 小时,远超普通集群。
在训练与推理场景中,超节点优势显著:低精度格式节省显存,统一内存支持更大批量长序列训练;通信性能提升 16 倍,实现计算与通信完全重叠;推理生成 Token 可纳秒级流入训练侧,单节点即可承载千亿参数模型权重,无需跨节点搬运数据。
把墙拆掉,修一条路
在全球 AI 算力格局中,英伟达凭借 CUDA 生态和 NVLink 私有协议构建了封闭壁垒。华为则选择开放路径:拆除围墙,改建高速公路。
去年 9 月,灵衢互联协议 2.0 技术规范全面开放,基础文档超 600 页,并举办多期公开课,允许合作伙伴基于该规范打造先进算力设施。同年年底,CANN、Mind 系列基础软件全量开源,兼容各类 AI 编程范式。至此,华为超节点生态已覆盖从互联协议、操作系统到大模型的全栈技术链路。
这是一种差异化的生存策略。面对 CUDA 的先发优势,开源 CANN 大幅降低了开发者迁移成本。目前,CANN 开源社区月活开发者超 3500 人,代码下载量突破千万级。
灵衢协议的开放,打破了海外巨头对互联协议话语权的垄断。其 UBoE 模式原生适配现有以太网基础设施,企业无需更换交换机即可部署,为国产算力提供了“不依赖 NVLink 也能高速互联”的可能。华泰证券测算,2028 年国产超节点市场空间有望达 3414 亿元。
开放的终极目标是从企业协议走向行业标准。工信部正牵头推进计算高速互连总线协议(CLink)标准制定,灵衢协议已成为重要参考依据。若各大国产芯片厂商能接入该体系,一个“国芯、国连、国用”的自主算力生态将真正成型。
IDC 数据显示,2025 年中国本土 AI 加速卡厂商国内市场份额已升至约 41%。从一家公司的协议到“中国标准”的建立,不仅是解决“卡脖子”问题的根本解法,更是提高国内算力供给可得性、降低外部不确定性的关键举措。
这条路能否走通,取决于产业链每一个参与者的共同努力。方向已然清晰:与其在别人的赛道上追赶,不如自己修路架桥。
END

