9月17日华为全联接大会2026,放出一个很多人没看懂的关键大招:
昇腾960DT 提前3个季度落地,2027年一季度就位!
原本还要再等一年多的新一代主力算力,直接提速近9个月。
配合同步官宣的950规模化商用、970/980未来两年迭代路线,华为对标英伟达的完整进攻蓝图,彻底摆到了台面上。
华为算力全面提速
● 老主力站稳脚跟:910C超节点累计部署突破1000套,是目前国产落地最稳、规模最大的算力底座。
● 当前主力全面商用:950超节点正式规模落地,承接当下大模型训练、推理主流需求。
● 下一代提前冲刺:960DT(训练旗舰)2027年Q1就绪、960PR(推理旗舰)2027年Q3就绪;970、980锁定2028、2029年持续迭代。
但,路线官宣 ≠ 立刻交付。
这次公布的4096卡 昇腾960超节点,是官方最终定型方案,算力规模8 EFLOPS FP8,也是未来行业落地的标准版本。
为什么950要分DT、PR?
很多人疑惑:同代芯片,为什么要做两个版本?
因为AI干活分两种,需求完全不一样,混用就是浪费钱。
✅ PR版本:负责“读题”
对应模型Prefill阶段,批量读取、处理输入内容。核心需求是算力足、成本低,主打高效性价比,适配推荐、批量输入场景。
✅ DT版本:负责“答题”
对应模型Decode生成、AI训练场景。核心需求不是单纯算力,而是内存大、读存快、数据搬运稳。
所以950DT直接拉满配置:144GB大内存、4TB/s本地带宽、2TB/s互联带宽,专门解决大模型训练、长文本推理的卡顿瓶颈。
简单说:华为不再用“一张芯片通吃所有场景”,分工精细化,算力利用率直接拉满。
2026-2029迭代时间表
这张时间表,看懂就看懂了华为未来三年的算力布局:
📌 910C:千套落地,稳做商用打底算力。
📌 950PR/DT:2026年分批落地,当下主力商用芯片。
📌 960DT:2027年Q1(提前9个月),新一代训练旗舰。
📌 960PR:2027年Q3,新一代推理主力。
📌 970/980:2028-2029年迭代,持续追平顶尖水平。
最大的意义:迭代节奏稳定、落地可预期。企业不用害怕硬件迭代断层、模型迁移白费功夫,国产算力进入可持续升级的良性循环。
960最大亮点
当算力集群做到几千、上万卡,真正的瓶颈从来不是芯片算力,而是数据传输、功耗、稳定性。
这也是960超节点最核心的升级:Hi-ONE光引擎 + NPO近封装光学技术。
把光电转换模块挪到芯片旁边,缩短传输路径、减少信号损耗,远距离传输全部用高速光路替代传统电路。
落地效果非常直观:用5500个光引擎,替代4.8万个传统光模块,单超节点省电550千瓦,器件大幅减少、故障率大幅降低。
超大算力集群,稳定可用的算力,远比纸面峰值算力更重要,这是华为系统层面的核心优势。
对标英伟达,现在到底差在哪?
不吹不黑,用官方公开数据,讲最真实的差距:
1、单卡硬实力:仍有差距
950DT内存、带宽基本对标H200,但对比最新的B300、Rubin,无论是内存容量、单卡算力峰值,都存在明显追赶空间。
且英伟达Rubin已于2026年8月量产出货,华为960DT要2027年一季度就位,对手一直在迭代,追赶难度不小。
2、集群互联:基本追平主流
950DT互联带宽2TB/s,超过B300的1.8TB/s,集群组网能力已经跟上国际主流,这也是华为能做4096卡超大集群的底气。
3、系统规模:华为优势明显
960超节点4096卡、8 EFLOPS总算力,远超英伟达NVL72 72卡集群规模。
但必须清醒:规模大≠单卡强。华为靠多卡组网堆出总算力,英伟达单卡密度、软件优化、实际算力转化率依然更强。
真正的胜负手:华为集齐了全栈生态
很多人只盯着单卡参数比拼,却忽略了AI算力的终极竞争:拼的是整套生态,不是单块芯片。
英伟达的壁垒,是芯片、CPU、网络、存储、软件栈的完整闭环。
而华为,已经完全搭建起国产自主的全栈体系:
🔹 昇腾NPU:核心AI计算
🔹 鲲鹏CPU:通用任务、工具调度
🔹 OceanStor存储:承接AI缓存,减少重复计算
🔹 灵衢UB:统一互联,打通全链路通信
🔹 CANN软件栈:模型适配、硬件优化
单卡差距可以靠迭代追赶,完整生态壁垒很难短期复制,这是华为最大的底气。
华为昇腾960提速落地,标志着国产AI算力进入主动迭代阶段,不再被动跟进;单卡极致性能仍落后英伟达最新产品,但系统能力、集群规模、生态完整性、供货稳定性已成为核心优势;2027-2029年迭代节奏清晰,国产算力正式进入“逐年升级、持续落地”的良性循环。
AI算力的长跑才刚刚开始,有完整蓝图、有落地节奏、有自主生态,就是国产算力最大的胜算。

