大数跨境

打破“算力存储通信”三堵墙,昇腾超节点给出十万亿大模型训推“最优解”

打破“算力存储通信”三堵墙,昇腾超节点给出十万亿大模型训推“最优解” 智东西
2026-09-25
5
导读:架构突破打底,工程细节搭桥,昇腾把千卡统成一台计算机。

架构突破打底,工程细节搭桥,昇腾把千卡统成一台计算机。
作者 |  云鹏
编辑 |  漠影
2026年,AI圈的核心关键词无疑是“智能体(Agentic AI)”。随着智能体从“能聊”向“能干”演进,AI编程等应用加速落地,带来生产力质变。随之而来的是AI推理需求呈指数级增长,预计到2030年,全球每月Token消耗将超120千万亿,暴涨24倍。
为支撑更复杂的任务,顶级MoE模型参数量迈入“十万亿级”,训练与推理压力剧增。传统服务器难以兼顾大模型高效训练与长上下文、低时延、低成本推理,“超节点”逐渐成为AI基础设施领域公认的更优解。通过将大量AI加速器紧密耦合为高密度计算单元,超节点能有效破解大模型训推中的“存储墙”与“通信墙”。
然而,超节点落地需克服集群内计算、存储等资源的通信瓶颈及统一调度难题。在华为全联接大会2026期间,昇腾950超节点正式上市,成为业界最大规模的商用超节点。

▲ 华为全联接大会2026昇腾展区

继去年昇腾910C超节点将“超节点”概念带入行业视野后,昇腾950如何攻克挑战实现规模化商用?正如华为昇腾计算产品线总裁张迪煊所言,大模型迭代带来新需求,昇腾超节点以大带宽、低时延和内存统一编址的确定性架构,应对AI发展的不确定性。

▲ 华为昇腾计算产品线总裁张迪煊

让超节点真正大规模落地,昇腾率先交出了答卷。

一、硬核技术与工程落地:让千卡如“单机”般高效运行

此次上市的昇腾950超节点包含Atlas 950 SuperPoD液冷超节点与Atlas 850E风冷超节点,精准匹配不同场景的AI基础设施建设需求。其中,Atlas 950 SuperPoD液冷超节点集成1024颗高性能NPU、1300多个灵衢互联套片、4000多个光模块和19万根CableTray,实现千卡协同,是一项极为复杂的系统工程。其能率先规模化商用,源于极强的技术领先性与扎实的工程化落地能力。

1. 架构与互联创新突破性能瓶颈

在芯片微架构方面,通过提升算子开发易用性,将数据搬运、格式转换、通信同步等下沉至硬件,大幅提升开发效率。在互联层面,灵衢高速互联技术通过统一协议实现1024卡统一内存编址,使跨卡远程内存访问如操作本地内存般便捷,芯片互联带宽较上代提升2.1倍,成功打破通信瓶颈。

2. 极致工程细节保障系统落地

在工程化创新上,昇腾自研TPSU电源模块提供储能能力,保障业务供电波峰需求。散热方面,针对单个950W功耗的NPU模组,采用高密铲齿、冰川铠甲冷板及多水路串联设计,单块冷板散热达2000W。正交架构设计实现柜内零线缆全电互联,单柜减少6000多根线缆,1024超节点节省50千米铜线,大幅降低时延并提升可靠性。此外,柜间光互联采用业界唯一的光模块液冷技术,单节点省电达数千户家庭年用电量;链路级重传与2+2光模块保护技术则彻底攻克“光模块易闪断”顽疾。

3. 训推性能双跃升,赋能千行百业

基于计算、存储、通信的高效协同,Atlas 950 SuperPoD在实际场景表现优异:训练侧效率提升1.5-1.7倍,实现万卡超节点集群月级稳定训练;推理侧在中心高并发场景下性能提升2-3倍,时延低于10ms。同时,昇腾成为国内唯一商用支持mxFP8低精训练和全流程支持mxFP4推理的厂商。
目前,昇腾超节点已广泛应用于互联网、金融、制造等行业。例如,蚂蚁阿福借助其实现健康AI服务的高效响应;德赛西威基于此构建算力底座,训推性能超越业界GPU平台。昇腾超节点从技术和工程层面为行业树立蓝本,助力十万亿级大模型训推算力基础设施建设。

二、风冷超节点直击痛点:免改造部署企业级机房

针对大量企业级通用风冷机房面临的液冷改造周期长、成本高等痛点,Atlas 850E风冷超节点应运而生,进一步推动超节点技术向传统机房普及。

1. 免液冷改造,大幅降低部署门槛

Atlas 850E基于自研相变散热技术,无需对现有风冷机房做液冷改造,标准风冷机柜可直接上架部署,支持32卡至768卡灵活扩展。这种“免改造”能力,有效解决了中小企业最关心的迁移成本与效率问题。

2. 极致低时延,满足高频推理需求

原生覆盖FP8、mxFP8、HiF8、INT8、mxFP4等全量低精格式,稳定实现10ms级时延推理。面对Agent多轮对话、高频KV缓存读写等需求,通过异构PD分离方案与大规模专家并行优化,Atlas 850E在万亿参数MoE模型推理中实现5-10ms极致低时延,单卡吞吐较业界风冷集群提升2.5倍。

三、系统软件与开放生态:为硬件装上“强大脑”

超节点夯实算力底座,而系统软件与开放生态则进一步释放潜能,推动超节点走向“好用易用”。

1. 系统软件深度释放算力

昇腾超节点系统软件涵盖灵衢总线管理、系统服务及超节点管理等组件。灵衢系统高阶服务支持跨物理节点统一内存编址,编程模式与单系统语义一致。基于内存语义和拓扑编排,1024卡域内集合通信性能提升1.6倍;大EP跨卡通信场景下,1K小包通信耗时从70微秒降至8.6微秒,性能提升8倍。

2. 开源生态降低开发门槛

去年,昇腾完成CANN和Mind系列的全面开源,兼容主流生态,推动AI开发从“专家专属”走向“人人可用”。目前CANN社区月活开发者突破5200名,位列中国开源项目活跃度第一。从部署到调优,昇腾全流程赋能开发者,让智能体时代的编程与创新更加简单。

四、结语:从首发到规模落地,重塑Agent时代算力底座

面对行业内“只见发布、不见落地”的困局,昇腾凭借底层架构创新与扎实的工程能力,系统性攻克超节点落地难题,实现液冷、风冷双形态全场景覆盖,让更多中小企业以低门槛享受超节点优势。
昇腾超节点在AI算力基建大考中率先交出优异答卷,为十万亿级大模型时代树立了新标杆。未来,超节点竞争本质是“硬件架构+系统工程+软件生态”的综合较量。随着技术与生态飞轮加速,先发优势将进一步扩大。
AI算力变革已至,昇腾正以坚实的“硅基黑土地”,为充满不确定性的AI未来提供一种更确定、更坚实的算力基石。
【声明】内容源于网络
0
0
智东西
各类跨境出海行业相关资讯
内容 11851
粉丝 0
智东西 各类跨境出海行业相关资讯
总阅读250.8k
粉丝0
内容11.9k