大数跨境

昇腾960DT出炉,国产算力真实水平到底如何?

昇腾960DT出炉,国产算力真实水平到底如何? 游方AI
2026-10-05
14
导读:9月17日,华为正式发布昇腾60DT芯片,同时推出4096卡超节点,刷新了国产单卡算力与超节点集群的双重纪录。


9月17日,华为正式发布昇腾60DT芯片,同时推出4096卡超节点,刷新了国产单卡算力与超节点集群的双重纪录。该芯片预计2027年一季度正式商用。

新品落地,也把一个尖锐问题摆上台面:国产算力和英伟达的真实差距,到底在哪?我们还有机会反超吗?

很多人误以为,差距只是芯片性能。但真实的行业竞争,早已不止单卡比拼。

单卡算力差距依旧明显

不吹不黑,单颗AI芯片的硬实力上,国产旗舰仍有不小差距。

从核心算力参数来看:昇腾960DT的FP8峰值算力,不足英伟达B300的一半,高精度FP4算力仅约三成。

这意味着,在常规单卡、少卡运算场景,英伟达的硬件优势依然稳固。

但我们也有惊喜突破:昇腾960DT显存容量对标B300,显存带宽甚至实现反超。

国产芯片暂时跑不快,但数据吞吐效率已经跟上甚至超越,走出了差异化的设计思路。

差距根源

先进制程是最大短板

单卡性能的落后,核心卡在芯片制造工艺上。

英伟达B300采用台积电4nm级先进工艺,晶体管数量突破2080亿,在算力、功耗、散热之间做到了极致平衡。

而国内目前主流先进工艺为中芯国际N+3(7nm迭代工艺),和国际顶尖4nm工艺存在明确代差。

制程受限,所有性能提升都会被掣肘:

想堆算力,就得放大芯片面积,成本、良品率双双承压;想提频率,就会面临功耗和散热难题。

芯片制程、设备、封装、设计是长期积累的系统工程,无法短期弯道超车。

不拼单卡

拼超大规模系统

单卡追赶需要时间,但算力市场不会等人。

所以华为换了一条赛道:单卡打不过,就靠集群体系取胜。

此次发布的4096卡昇腾超节点,就是国产算力的核心杀手锏。对比英伟达仅72卡的高速互联集群,华为直接把集群规模拉到行业顶尖水平,还支持跨节点统一内存编址,实现全域低时延、高带宽协同。

这套打法,精准适配不同应用场景:

1、适合超节点发力:大模型大规模训练

大模型训练需要数千芯片联动运算,数据交互频繁。4096卡超大集群能大幅减少芯片空转等待,用整体集群效率,对冲单卡算力的不足,完美适配超大规模算力需求。

2、超节点优势失效:常规推理、Token工厂业务

这类业务多采用小副本部署,单任务仅需少量显卡,靠叠加副本提升并发。哪怕拥有万卡集群,也用不上大规模互联能力,依旧比拼单卡性能和软件优化。

硬件拼规模,软件拼生态

大规模集群,只是硬件基础,软件才是决定实力的关键。

英伟达凭借成熟的CUDA生态、NVLink互联技术,构筑了极高的行业壁垒,适配性和稳定性稳居行业第一。

华为则依托CANN自研工具链,持续优化任务拆分、数据调度、负载均衡,全力把硬件集群规模,转化为落地可用的真实算力。

更关键的是,算力集群竞争,不止是芯片之争。

国内完备的通信设备、数据中心基建、电力配套、大型工程交付能力,都是我们独有的产业优势,是海外厂商无法复刻的底气。

最后理清一个核心认知:超节点集群,无法抹平单卡算力的差距。在少卡、高密度计算场景,我们依然要持续追赶英伟达。

但国产算力找到了专属突围路径:避开单卡硬碰硬,在系统集群层面弯道超车。

未来国产算力的发展方向十分清晰:

✅ 补短板:持续攻坚制程工艺、单卡算力、软件生态,缩小核心硬件差距。

✅ 造优势:发挥国内产业优势,靠超大规模超节点,抢占大模型训练等高端算力赛道。

单卡深耕补短板,集群突围建优势,双线并行,这就是国产算力的逆袭之路。

扫码关注



游方AI




【声明】内容源于网络
0
0
游方AI
AIGC生态玩家,从数字化工具到变现
内容 373
粉丝 0
游方AI AIGC生态玩家,从数字化工具到变现
总阅读5.5k
粉丝0
内容373