大数跨境

WAIC 特别策划 | 国产算力 「超节点」时代全面来临

WAIC 特别策划 | 国产算力 「超节点」时代全面来临 大计算AI产业平台
2026-07-21
3
导读:2026 年 7 月 17 日 - 7 月 20 日,WAIC 2026 在上海世博中心成功举办。

2026 年 7 月 17 日 - 7 月 20 日,WAIC 2026 在上海世博中心成功举办。本届大会传递出清晰的信号:AI 算力竞争已从单一芯片的 GPU 参数比拼,全面转向系统级超节点(SuperPod)的较量Atlas 950 超节点真机首次公开展出并荣获 SAIL 大奖,曙光公布全国产十万卡集群,天数智芯发布天垓 300……本文为您拆解国产算力的最新格局与进化方向。

01

PART

WAIC 2026 国产超节点全景

DOMESTIC SUPERPOD LANDSCAPE

方案
集群规模
系统算力
核心互联
商用状态
Atlas 950 SuperPoD 
1024 卡 NPU
1 EFLOPS FP8
灵衢协议 / 3μs RTT
真机已展出
曙光8000(登峰)
十万卡级
~10 EFLOPS FP8
国产全栈自研互联
展台展示
中兴 OEX 超节点
多 GPU 集群
数据未完全披露
Matrix 多国产 GPU 融合
展台展示
沐曦曦景 S600
600+ 卡
数据未完全披露
自研互联协议
展台展示
摩尔线程超节点
256–512 卡
数据未完全披露
自研互联协议
展台展示
曦智 光跃 LightSphere X
2000 卡(光互连)
光电混合计算
全光交换 OCS
已规模化落地

最瞩目的无疑是Atlas 950 超节点,这款 1024 卡 NPU 集群以 1 EFLOPS FP8 算力荣获大会 SAIL 奖。基于灵衢互联协议,256TB 统一内存编址、3μs RTT 超低时延,首次实现了跨物理节点的统一内存编址。而前代 384 超节点已累计部署 750+ 套,覆盖互联网、金融、医疗等 20+ 行业,是国内唯一训练出 SOTA 模型的商用超节点。


02

PART

芯片新品:天垓 300 等集中发布

NEW CHIP LAUNCHES AT WAIC 2026

产品
核心亮点
对标性能
生态状态
天数智芯 天垓 300
Attn 效率>90%, MoE 效能>Hopper 10%
Decode 性能超 Hopper 10%
已规模化部署
壁仞 壁砺 166L
国产算力支持全流程AI作曲
NPO 光互联/1024卡扩展
千卡级部署
曦智 PACE 2
全球首款光电混合计算盒「天枢·光立方」
PACE 3 已流片
战略合作构建中
云天励飞 DeepVerse
Prefill/Decode/FFN 专用化芯片路线图
万卡异构集群协同
2026–2027路线图

🎯 天垓 300 关键性能数据

Attention 效率

>90%

超 Hopper 方案 10%

MoE 效能

+10%

vs Hopper 架构

首字延迟

-20%

Decode 通信延迟 -13%

03

PART

从芯片到系统:三大竞争维度

BOARD → SYSTEM → ECOSYSTEM

 维度一:互联协议竞技 

WAIC 2026 现场,各家争相展示自研互联方案——华为灵衢协议(3μs RTT)、壁仞 BLink 2.0(在网计算+拥塞控制)、百度 XPU-Link(32–1024卡扩展)、摩尔线程自研互联协议…… 各家都在试图通过独有的通信协议定义超节点内的数据流动效率。互联已经成为算力集群的第一竞争力。

 维度二:物理工程极限 

一个超节点功耗可达 400KW,单台高密度机柜 48KW(三年前国内普通机柜仅 6KW)。供电、液冷散热、承重、布线——每一项都是工程级挑战。摩尔线程直言:超节点里坏一张卡,价值上亿的设备就可能停摆,可靠性解耦性成为关键。

 维度三:下一代探索方向 

大会释放了多个前沿信号——光互连(壁仞 NPO / 曦智 2000 卡全光交换)、面板级封装(燧原 CoPoS / 玻璃基板)、太空算力(上海「星枢计划」天地一体化 / 清微太空 AI 2026 年底入轨)。算力布局正从地面扩展到太空,从电互连走向光互连。



04

PART

系列对比

BLACKWELL BENCHMARK

维度
 GB300 
Atlas  950 SuperPoD
曙光8000(登峰)
集群类型
GB300 × 72( 机柜)
950DT × 1024(超节点)
十万卡级(全国产)
算力规模
~0.72 EFLOPS FP8
1 EFLOPS FP8
~10 EFLOPS FP8(预估)
显存统一编址
单卡 288GB HBM3e×72
256TB 全局统一编址
国产全栈自研
互联带宽
NVLink 5 / 900 GB/s
灵衢 TB 级 / 3μs RTT
国产全栈自研
核心能耗
单卡 1400W,整柜≈100KW
超节点≈400KW
十万卡级液冷部署

关键洞察: Atlas 950 超节点在 1024 卡规模下实现了 1 EFLOPS FP8,性能赶超英伟达 GB300。简单换算:Atlas 950 用 14 倍卡数实现了相当的集群算力——这是单卡算力差距的真实写照。但另一方面,曙光 8000(登峰)以十万卡级全国产方案提供了约 10 EFLOPS 的系统级算力。从 WAIC 2025 到 WAIC 2026,国产算力最宝贵的不是缩小了单卡差距,而是 跨越了「从单卡到系统」的门槛。

05

PART

结论与展望

OUTLOOK

 国产算力「超节点」能力已初步站稳 

Atlas 384 超节点已部署 750+ 套并训练出多个 SOTA 模型,系统成熟度已获商用验证。十万亿级参数模型的训练场景, 950 超节点已具备交付能力。

 生态仍是最大短板 

CUDA 依然拥有压倒性优势。但大会透露了新趋势:产业界正推动「写一套代码,适配所有国产硬件」的统一工具链构想,以及 CANN / MindSpore 的全面开源开放。生态整合是国产算力走向独立的最后一道关口。

 未来方向:Token 价值取代 TFLOPS 竞赛 

燧原科技在大会提出:Token 正成为 AI 产业核心计价单位,行业关注重点从「算力规模」转向「Token 生成效率与交付质量」。当国产超节点集群初步建成,谁能以最低的 Token 成本提供最可靠的服务,谁就是真正的赢家。

CLOSING

从 WAIC 2025 的「单卡对标」到 WAIC 2026 的「超节点集群」,国产算力用一年时间跨出了最艰难的一步:系统化。单卡追赶仍在路上,但集群层面的算力供给已可支撑十万亿参数模型的训练与推理。下一年,当全国产十万卡集群和光互连全面铺开,也许我们会看到一个全然不同的算力版图。

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连

在看
收藏

【声明】内容源于网络
0
0
大计算AI产业平台
开市科技重点打造大计算AI产业平台,承接全国各省市算力中心运营管理,提供涵盖AI硬件、算力租售、数据服务、算力维保等全包式算力解决方案,推动AI资源走向开放化、普惠化。
内容 40
粉丝 0
大计算AI产业平台 开市科技重点打造大计算AI产业平台,承接全国各省市算力中心运营管理,提供涵盖AI硬件、算力租售、数据服务、算力维保等全包式算力解决方案,推动AI资源走向开放化、普惠化。
总阅读147
粉丝0
内容40