大数跨境

十万卡超算能烧开西湖水?算力的上限,卡在散热了

十万卡超算能烧开西湖水?算力的上限,卡在散热了 全球半导体观察
2026-10-07
29

液冷技术

“曙光8000十万卡AI超算集群全速运行一年半,产生的总热量足以烧开整个西湖的水。”这一比喻形象地揭示了顶级AI算力的热负荷挑战。

随着芯片算力、模型参数及集群规模的不断刷新,电能转化为热能的物理事实未变,散热能力已成为制约算力上限的关键瓶颈。曙光8000采用相变浸没液冷加金刚石铜复合导热材料,成功解决了十万颗芯片的散热难题。从头部云厂商数据中心到商用AI服务器,散热已从单纯的机房配套问题,转变为关乎算力落地、成本控制及稳定运行的核心要素。

01 算力在涨,散热先撞墙

近年来,AI集群功率曲线急剧上升。早期数据中心单机柜功耗多为5-10kW,普通风冷即可应对;如今AI训练集群单机柜普遍突破80kW甚至100kW,十万卡集群机柜功耗正迈向兆瓦级。单颗AI芯片功耗也从百瓦级跃升至千瓦级,局部热流密度成倍增长。

功耗激增而散热滞后,导致传统风冷下高负载服务器易触发降频,算力缩水且宕机风险增加。数据显示,老旧风冷数据中心的散热能耗占总用电的30%-50%,是运营主要成本。例如,贵州国家算力枢纽基地早年因高温保护性降频,服务器有效算力仅发挥70%。

算力高密度升级已成常态。近日,中国移动北京公司联合中国移动云公司宣布,华为昇腾950DT千卡超节点落地昌平区信息港数据中心。该节点基于华为超节点架构,单节点搭载1024卡,峰值算力达1EFLOPS(FP8),支持256TB统一内存与微秒级低时延,旨在支撑大模型训推等高阶需求。

此类高密度算力集群的持续落地,虽推动了算力规模扩容,但也导致整体热负荷与芯片局部热流密度飙升,散热短板被进一步放大,成为制约超高密算力集群稳定运行与效能释放的核心瓶颈。

02 三条技术路线,适配不同功率密度

目前行业并行风冷、冷板式液冷、浸没式液冷三条技术路线,各自适配不同的算力密度场景。

风冷

风冷依靠服务器风扇强制对流及机房精密空调换热,具有产业链成熟、运维简单、改造成本低等优势,仍是老旧IDC和中型云厂商推理集群的主流选择。

其短板在于空气换热效率低,单机柜功率上限约为30kW,高负载下噪音大、PUE难以压低,且无法解决芯片局部热点。行业普遍认为,同等配置下,风冷集群长期满载会导致芯片温度偏高15℃-25℃,加速硬件老化并限制算力满负荷释放。因此,AI高密度新建项目基本不再选用风冷,仅将其作为低功耗推理场景的补充。

冷板式液冷

冷板式液冷将微通道金属冷板贴合于GPU、CPU等核心发热芯片表面,通过冷却液循环带走核心热量,内存、电源等器件仍靠空气散热。这是从传统机房向全液冷过渡的折中方案。

相比浸没式,冷板式对服务器改动小,可沿用传统运维,初期建设成本据测算可降低30%-40%。但其仅覆盖核心芯片,整机散热不彻底,单机柜功耗存在上限,且管路接头存在渗漏风险。

实测显示,商用冷板式液冷方案可将PUE控制在1.15以内,覆盖大部分通算及智算升级场景。腾讯、百度、华为云的中型AI算力集群多采用此路线。对比风冷,冷板式可降低机房能耗25%以上,芯片运行温度降低10-18℃。

浸没式

浸没式是散热效率最高的路线,分为单相和相变两种。

单相浸没将服务器整机浸泡在绝缘冷却液中,利用液体显热换热;相变浸没则使用低沸点冷媒,通过液体沸腾汽化带走大量热量(如曙光8000)。该方案可实现整机无死角散热,消除局部热点,PUE最低可达1.05。但代价高昂:设备需重新设计,冷却液价格昂贵(高端氟化冷却液每升超500元,单柜用量400-600升),且需建立全新的运维体系。

浸没式是十万卡、百万卡集群及超高密智算中心的首选。阿里云仁和数据中心是全球规模最大的全浸没液冷数据中心之一,位于杭州余杭,为国内首座5A级绿色液冷数据中心。该项目采用单相浸没液冷技术,省去风扇与机房空调,PUE最低降至1.09,每年节电7000万度,完成了大规模全浸没液冷在云算力场景的商用验证。

03 散热最后一毫米:导热材料

液冷主要解决“热量外排”问题,而芯片到散热器之间的导热材料决定了热量能否快速导出。若界面热阻过高,即便液冷系统再高效,热量堆积仍会导致芯片降频。

传统基底材料为纯铜和铝。纯铜导热系数为401W/(m·K),工艺成熟且价格低廉,适配普通风冷和低功耗冷板。但当单颗芯片功耗达到千瓦级、热流密度激增时,铜的导热速率已显不足,导致界面热阻升高,热量难以导出。

金刚石铜复合材料结合了金刚石的超高导热性与铜的工艺适配性。据曙光披露,其导热能力是纯铜的两倍以上。曙光8000采用裸芯片直接焊接金刚石铜散热器,去除了传统金属上盖和导热垫片的多层结构,大幅压缩导热路径、降低界面热阻,有效解决了十万卡集群的局部热点堆积问题,保障了集群长期全速运行。该工艺此前在国内规模化落地难度较高。

此外,芯片与散热底座间的热界面材料(TIM)也在升级。传统导热硅脂在长期高温下易干涸老化,无法适应AI服务器7×24小时运行需求。据报道,华为、浪潮的高端AI服务器已批量采用液态金属替代硅脂。石墨散热膜、碳化硅热沉等新材料也在边缘算力和小型高密度服务器中进行试点。

“烧开西湖水”仅是将算力能耗具象化。AI算法迭代与算力规模翻倍受制于物理定律,热量的产生与散去必须遵循科学规律。从曙光8000的相变浸没加金刚石散热方案,到各云厂商及算力枢纽的液冷落地,行业已投入巨大资源。算力能否持续攀升,关键在于散热技术能否同步跟进。

#AI服务器 #液冷技术 #AI算力

关于集邦咨询

TrendForce集邦咨询作为全球高科技产业研究机构,致力于洞察AI全链脉络,助力企业战略决策。研究版图聚焦AI产业增长引擎,涵盖:HBM、DRAM、NAND Flash等关键存储产品;GPU、ASIC等AI算力芯片;晶圆代工、芯片设计及封测;以及AI服务器、显示面板、LED、AR/VR等基础设施与终端,延伸至自动驾驶、具身智能、光伏储能、低空经济等“AI+”垂直产业集群,同时提供核心零部件价格预测与数据库。凭借多年深耕,为政企客户与投资者提供行业研究报告、企业战略咨询及品牌整合行销等服务。

【声明】内容源于网络
0
0
全球半导体观察
1234
内容 4341
粉丝 0
全球半导体观察 1234
总阅读141.6k
粉丝0
内容4.3k