上一篇我们拆解了英伟达Vera Rubin NVL72的整体结构,今天继续往下看其中的液冷系统。
上一代GB300 NVL72和Vera Rubin NVL72都采用72颗GPU,但需要处理的整柜热量进一步提高。作为量级参考,GB300 NVL72整柜最高功耗约142kW,而最新DSX设施参考设计已经按照Vera Rubin NVL72最高330kW的机柜热设计值规划。
Rubin继续采用整柜100%液冷,但需要处理的热负载已经进一步提高。它采用暖水单相直接液冷(Single-Phase Direct Liquid Cooling,DLC),最高支持45°C冷却液入口温度,芯片和网络组件都进入封闭液冷回路。
下面就沿着冷却液实际流动的方向,从CDU一路走到Cold Plate,再沿回液返回,看看一台Rubin NVL72的液冷系统由哪些部分组成。
冷却液从CDU进入机柜
Rubin NVL72的服务器侧冷却液首先经过冷却分配单元(Cooling Distribution Unit,CDU)。
Rubin支持最高45°C暖水入口。这里的45°C指进入服务器液冷系统的冷却液温度,并不是GPU或CPU工作温度。芯片工作时温度更高,热量仍然可以从芯片传到Cold Plate,再进入温度较低的冷却液。
CDU送出的冷却液随后进入机柜液冷歧管(Rack Manifold)。
供液路径:CDU→Rack Manifold
冷却液经过Rack Manifold完成整柜分配
Rack Manifold是一组负责分配和汇集冷却液的主管。
供液侧把CDU送来的冷却液分给机柜里的不同液冷模块,回液侧则把各模块吸热后的冷却液重新汇集起来。
第三代MGX采用新的机柜UQD08液冷歧管(Rack UQD08 Manifold),同时增加新的托盘内部Manifold和液冷Busbar。冷却液因此先在机柜一级完成分配,再进入不同托盘。
Vera Rubin NVL72包含18个计算托盘(Compute Tray)和9个NVLink交换托盘(NVLink Switch Tray)。Rubin采用100%液冷,Compute Tray和NVLink Switch Tray均采用无风扇设计,交换芯片和其他网络组件产生的热量也由液冷系统带走。
液冷还延伸到机柜供电部分。第三代MGX采用液冷铜母排(Liquid-Cooled Busbar),最高支持约5000A电流。Busbar负责向不同模块输送大电流,同时需要带走输电过程中产生的热量。
机柜内还设置漏液收集托盘(Leak Containment Tray)等液冷相关机械结构,用于承接液路出现泄漏时流出的冷却液。
沿Compute Tray这条支路继续向下,Rack Manifold通过快速接口与托盘液路连接。
供液路径:Rack Manifold→UQD
冷却液进入Compute Tray后继续分流
机柜液路与Compute Tray之间通过液冷快速接头(Quick Disconnect,QD)连接,其中Rubin采用通用快速接头(Universal Quick Disconnect,UQD)。UQD相当于机柜液路和托盘液路之间的可快速插拔接口,负责连接供液和回液;Compute Tray需要拆装或维护时,可以断开UQD,而不需要重新拆卸整套液冷管路。
冷却液经过UQD进入Compute Tray后,会进入托盘内部液冷歧管(Internal Tray Manifold),后文简称Tray Manifold。
Rack Manifold负责整台机柜的冷却液分配,Tray Manifold负责单个Compute Tray内部继续分流。第三代MGX针对Rubin重新设计了Tray Manifold和Rack UQD08 Manifold,以支持更高的冷却能力。
一个Rubin Compute Tray包含2颗Vera CPU和4颗Rubin GPU,同时还有ConnectX-9、BlueField-4等网络模块。冷却液进入托盘以后,由Tray Manifold继续分配到不同液冷区域。
Rubin Compute Tray采用无软管设计。“无软管”并不是托盘内部没有冷却液流道,而是使用Tray Manifold和模块化接口,替代传统托盘内部大量分散的柔性软管连接。Compute Tray同时取消内部风扇,由液冷系统承担内部散热。
供液路径:UQD→Tray Manifold
冷却液经过Cold Plate带走芯片热量
冷却液从Tray Manifold继续分流后,进入贴近发热器件的液冷板(Cold Plate)。
Cold Plate是一种内部带有冷却液流道的金属换热部件。它贴近CPU、GPU等高功耗器件,芯片产生的热量经过封装和导热界面传到Cold Plate,再被内部流动的冷却液带走。
Rubin的液冷范围不只覆盖GPU。NVIDIA称Rubin这一代实现100%液冷,芯片和网络组件都由封闭液冷回路散热,系统内部不再依赖风扇。
9个NVLink Switch Tray也采用全液冷设计,与Compute Tray一样属于机柜液冷系统的一部分。
这一位置同时存在两条不同方向的路径:
供液路径:Tray Manifold→Cold Plate
热量路径:Vera CPU/Rubin GPU等发热器件→Cold Plate→冷却液
冷却液沿回液路径返回CDU
Cold Plate吸收热量后,冷却液开始沿回液侧返回。
不同Cold Plate的回液先在Tray Manifold汇集,再经过UQD离开Compute Tray。不同托盘和其他液冷模块的回液随后进入Rack Manifold,最终返回CDU。
Rubin可以根据数据中心设计采用不同的服务器侧冷却介质。NVIDIA列出的选择包括去离子水(Deionized Water)和丙二醇基冷却液(Propylene Glycol-Based Fluid,PG25)。这些液体在封闭回路中长期流经Cold Plate、Manifold、UQD和其他接液部件。
一条Compute Tray支路由此形成完整的服务器侧液冷回路:
回液路径:Cold Plate→Tray Manifold→UQD→Rack Manifold→CDU
热量从CDU传向数据中心设施侧
冷却液回到CDU以后会继续循环使用,但它从CPU、GPU等器件带回来的热量还没有离开数据中心。
45°C暖水设计也降低了数据中心冷却系统对低温冷水的需求。在环境条件合适时,设施侧冷却水可以通过干式冷却器(Dry Cooler)向室外空气排热,从而减少机械制冷设备的运行。
服务器侧冷却液始终在自己的闭环中循环:
服务器侧液路:CDU→Rack Manifold→UQD→Tray Manifold→Cold Plate→Tray Manifold→UQD→Rack Manifold→CDU
热量则继续向外传递:
热量路径:芯片→Cold Plate→服务器侧冷却液→CDU换热器→设施侧冷却水→Dry Cooler/Chiller→外部环境
液冷继续向更高密度机柜延伸
Vera Rubin NVL72继续采用45°C暖水和整柜液冷设计,液冷覆盖芯片、网络和供电等部件,同时与数据中心设施侧冷却系统配套设计。
NVIDIA下一步仍在继续提高机柜计算密度,并配套新的液冷和机械结构。面向下一代Kyber机架,液冷仍是支撑更高密度机架级计算的重要设计方向。
从Rubin NVL72继续往下拆,Cold Plate、UQD、Manifold和CDU本身又可以继续拆成材料、加工、密封和测试等不同环节。
英伟达Vera Rubin NVL72机架结构拆解
从L1到L12,服务器组装流程拆解

