大数跨境

英伟达Vera Rubin NVL72液冷系统拆解

英伟达Vera Rubin NVL72液冷系统拆解 3C供应链
2026-09-28
31

上一篇我们拆解了英伟达Vera Rubin NVL72的整体结构,今天继续往下看其中的液冷系统。


上一代GB300 NVL72和Vera Rubin NVL72都采用72颗GPU,但需要处理的整柜热量进一步提高。作为量级参考,GB300 NVL72整柜最高功耗约142kW,而最新DSX设施参考设计已经按照Vera Rubin NVL72最高330kW的机柜热设计值规划。

Rubin继续采用整柜100%液冷,但需要处理的热负载已经进一步提高。它采用暖水单相直接液冷(Single-Phase Direct Liquid Cooling,DLC),最高支持45°C冷却液入口温度,芯片和网络组件都进入封闭液冷回路。

下面就沿着冷却液实际流动的方向,从CDU一路走到Cold Plate,再沿回液返回,看看一台Rubin NVL72的液冷系统由哪些部分组成。

冷却液从CDU进入机柜


Rubin NVL72的服务器侧冷却液首先经过冷却分配单元(Cooling Distribution Unit,CDU)。

CDU位于服务器液冷回路和数据中心设施冷却系统之间。它负责推动服务器侧冷却液循环,并控制流量和压力,同时通过内部换热器把服务器产生的热量传给数据中心设施侧冷却水。这套水不进入Rubin机柜,而是负责把CDU接收到的热量继续带到数据中心冷却设备。
NVIDIA DSX设施参考设计采用液对液冷却分配单元(Liquid-to-Liquid CDU)。CDU一侧是Rubin服务器侧冷却液,另一侧是数据中心设施侧冷却水。两套液体分别在自己的管路中循环,只通过CDU内部的换热器传递热量,本身不会混合。

Rubin支持最高45°C暖水入口。这里的45°C指进入服务器液冷系统的冷却液温度,并不是GPU或CPU工作温度。芯片工作时温度更高,热量仍然可以从芯片传到Cold Plate,再进入温度较低的冷却液。

CDU送出的冷却液随后进入机柜液冷歧管(Rack Manifold)。

供液路径:CDU→Rack Manifold

冷却液经过Rack Manifold完成整柜分配


Rack Manifold是一组负责分配和汇集冷却液的主管。

供液侧把CDU送来的冷却液分给机柜里的不同液冷模块,回液侧则把各模块吸热后的冷却液重新汇集起来。

第三代MGX采用新的机柜UQD08液冷歧管(Rack UQD08 Manifold),同时增加新的托盘内部Manifold和液冷Busbar。冷却液因此先在机柜一级完成分配,再进入不同托盘。

Vera Rubin NVL72包含18个计算托盘(Compute Tray)和9个NVLink交换托盘(NVLink Switch Tray)。Rubin采用100%液冷,Compute Tray和NVLink Switch Tray均采用无风扇设计,交换芯片和其他网络组件产生的热量也由液冷系统带走。

液冷还延伸到机柜供电部分。第三代MGX采用液冷铜母排(Liquid-Cooled Busbar),最高支持约5000A电流。Busbar负责向不同模块输送大电流,同时需要带走输电过程中产生的热量。

机柜内还设置漏液收集托盘(Leak Containment Tray)等液冷相关机械结构,用于承接液路出现泄漏时流出的冷却液。

沿Compute Tray这条支路继续向下,Rack Manifold通过快速接口与托盘液路连接。

供液路径:Rack Manifold→UQD

冷却液进入Compute Tray后继续分流


机柜液路与Compute Tray之间通过液冷快速接头(Quick Disconnect,QD)连接,其中Rubin采用通用快速接头(Universal Quick Disconnect,UQD)。UQD相当于机柜液路和托盘液路之间的可快速插拔接口,负责连接供液和回液;Compute Tray需要拆装或维护时,可以断开UQD,而不需要重新拆卸整套液冷管路。

冷却液经过UQD进入Compute Tray后,会进入托盘内部液冷歧管(Internal Tray Manifold),后文简称Tray Manifold。

Rack Manifold负责整台机柜的冷却液分配,Tray Manifold负责单个Compute Tray内部继续分流。第三代MGX针对Rubin重新设计了Tray Manifold和Rack UQD08 Manifold,以支持更高的冷却能力。

一个Rubin Compute Tray包含2颗Vera CPU和4颗Rubin GPU,同时还有ConnectX-9、BlueField-4等网络模块。冷却液进入托盘以后,由Tray Manifold继续分配到不同液冷区域。

Rubin Compute Tray采用无软管设计。“无软管”并不是托盘内部没有冷却液流道,而是使用Tray Manifold和模块化接口,替代传统托盘内部大量分散的柔性软管连接。Compute Tray同时取消内部风扇,由液冷系统承担内部散热。

供液路径:UQD→Tray Manifold

冷却液经过Cold Plate带走芯片热量


冷却液从Tray Manifold继续分流后,进入贴近发热器件的液冷板(Cold Plate)。

Cold Plate是一种内部带有冷却液流道的金属换热部件。它贴近CPU、GPU等高功耗器件,芯片产生的热量经过封装和导热界面传到Cold Plate,再被内部流动的冷却液带走。

Rubin的液冷范围不只覆盖GPU。NVIDIA称Rubin这一代实现100%液冷,芯片和网络组件都由封闭液冷回路散热,系统内部不再依赖风扇。

9个NVLink Switch Tray也采用全液冷设计,与Compute Tray一样属于机柜液冷系统的一部分。

这一位置同时存在两条不同方向的路径:

供液路径:Tray Manifold→Cold Plate

热量路径:Vera CPU/Rubin GPU等发热器件→Cold Plate→冷却液

冷却液沿回液路径返回CDU


Cold Plate吸收热量后,冷却液开始沿回液侧返回。

不同Cold Plate的回液先在Tray Manifold汇集,再经过UQD离开Compute Tray。不同托盘和其他液冷模块的回液随后进入Rack Manifold,最终返回CDU。

Rubin可以根据数据中心设计采用不同的服务器侧冷却介质。NVIDIA列出的选择包括去离子水(Deionized Water)和丙二醇基冷却液(Propylene Glycol-Based Fluid,PG25)。这些液体在封闭回路中长期流经Cold Plate、Manifold、UQD和其他接液部件。

一条Compute Tray支路由此形成完整的服务器侧液冷回路:

回液路径:Cold Plate→Tray Manifold→UQD→Rack Manifold→CDU

热量从CDU传向数据中心设施侧


冷却液回到CDU以后会继续循环使用,但它从CPU、GPU等器件带回来的热量还没有离开数据中心。

在NVIDIA DSX参考设计中,服务器侧冷却液回到Liquid-to-Liquid CDU后,通过内部换热器把热量传给设施侧冷却水。服务器侧冷却液随后继续在Rubin和CDU之间循环,而设施侧冷却水则把热量带到Dry Cooler或需要时使用的冷水机组(Chiller),最终排到外部环境。

45°C暖水设计也降低了数据中心冷却系统对低温冷水的需求。在环境条件合适时,设施侧冷却水可以通过干式冷却器(Dry Cooler)向室外空气排热,从而减少机械制冷设备的运行。

服务器侧冷却液始终在自己的闭环中循环:

服务器侧液路:CDU→Rack Manifold→UQD→Tray Manifold→Cold Plate→Tray Manifold→UQD→Rack Manifold→CDU

热量则继续向外传递:

热量路径:芯片→Cold Plate→服务器侧冷却液→CDU换热器→设施侧冷却水→Dry Cooler/Chiller→外部环境

液冷继续向更高密度机柜延伸


Vera Rubin NVL72继续采用45°C暖水和整柜液冷设计,液冷覆盖芯片、网络和供电等部件,同时与数据中心设施侧冷却系统配套设计。

NVIDIA下一步仍在继续提高机柜计算密度,并配套新的液冷和机械结构。面向下一代Kyber机架,液冷仍是支撑更高密度机架级计算的重要设计方向。

从Rubin NVL72继续往下拆,Cold Plate、UQD、Manifold和CDU本身又可以继续拆成材料、加工、密封和测试等不同环节。

  • 英伟达Vera Rubin NVL72机架结构拆解

  • 从L1到L12,服务器组装流程拆解


【声明】内容源于网络
0
0
3C供应链
1234
内容 165
粉丝 1
3C供应链 1234
总阅读19.6k
粉丝1
内容165