大数跨境

智算中心液冷技术方案

智算中心液冷技术方案 鹏博士研究院
2026-07-27
6
导读:智算中心液冷技术方案

本公众号部分分享的资料来自网络收集和整理,所有文字和图片版权归属于原作者所有,且仅代表作者个人观点,与本公众号无关,文章仅供读者学习交流使用,并请自行核实相关内容,如文章内容涉及侵权,请联系后台管理员删除。

来源:新CG资源

AI大模型的规模化落地正在重塑算力基础设施的底层逻辑。从ChatGPTDeepSeek,从文本交互到视频生成,大模型正从单模态向多模态快速演进,AI算力需求以远超摩尔定律的速度增长。当单机柜功率从传统数据中心的3-10kW飙升至100kW以上,风冷方案在12kW/柜的临界点前已力不从心,液冷技术不再是「更优选择」,而是智算中心建设的必要条件。

一、环境背景

AI大模型的爆发式增长正在从根本上改变算力基础设施的技术要求。大模型从文本交互到视频生成、从单模态向多模态的演进,驱动着AI算力需求每三至四个月翻一番。国务院审议通过《关于深入实施「人工智能+」行动的意见》,明确提出推进人工智能规模化商业化应用,国家发改委同步推进国家人工智能应用中试基地建设。政策与需求双轮驱动下,智算中心建设全面提速,广义智算中心已从单纯的算力物理载体演进为「算力+数据+算法」融合服务的重要引擎。

传统数据中心的制冷方案正面临前所未有的挑战。GPU芯片TDP已从300W攀升至700W甚至更高,英伟达Rubin架构单机柜功率突破100kW,全面采用液冷且无风扇设计。一个关键趋势在于,当芯片功耗超过300W时风冷已难以有效散热,而AI服务器的GPU/NPU芯片功耗正从400W向700W甚至1000W迈进。

同时PUE管控持续加码,工信部要求新建大型数据中心PUE低于1.3,发改委要求东部枢纽低于1.25、西部低于1.2,绿色节能示范项目要求1.15以下。从行业实践看,12kW/柜以下风冷方案更经济,12-15kW是风冷液冷过渡区,超过15kW液冷方案综合成本更优。当AI服务器单机柜功率密度达50-100kW时,液冷已非选择题,而是必答题。

二、解决方案

(一)冷板式液冷:当前产业化的主力路径

冷板式液冷是当下应用最广泛、产业链最成熟的液冷方案,其核心逻辑是通过冷板(Cold Plate)直接贴合CPU、GPU等发热芯片,利用液体的高导热特性带走热量。同体积液体的散热能力是空气的3000倍,导热能力是空气的25倍,同等散热水平下系统噪音比风冷降低10-15dB,节电约30%。

从系统架构来看,冷板式液冷分为一次侧和二次侧。一次侧包括冷水机组、冷却塔等室外设备,二次侧则由CDU(冷却分配装置,相当于系统的「心脏」)、Manifold(分歧管,相当于系统的「血管」)、冷板(相当于系统的「皮肤」)和快接头等核心部件组成。CDU负责将一次侧的冷量精准分配给各机柜,快接头实现了液冷系统的热插拔和在线维护。冷板式液冷目前约可带走IT设备60%-80%的芯片发热量,剩余20%-40%仍需通过风冷形式辅助散热。

在冷却液选择上,行业以25%乙二醇溶液和25%丙二醇溶液为主流。华为、曙光倾向乙二醇方案,浪潮、新华三则倾向丙二醇方案。去离子水虽然导热系数和比热容最优,但需要添加缓蚀剂和杀菌剂,且混合杂质后会导电,对系统维护要求极高。浸没式液冷则将IT设备完全浸入绝缘冷却液中,散热效率最高,PUE可低至1.05,单柜密度可达200kW以上,分单相浸没和相变浸没两种路径。喷淋式液冷通过喷头将冷却液直接喷洒到发热元件表面,当前应用最少。从产业格局看,冷板式凭借结构颠覆性低、标准化程度高、初始投资适中的综合优势,占据90%以上的市场份额。

(二)技术迭代加速:从「可选」到「标配」

液冷技术的规模化拐点正在来临,核心驱动力来自三个层面。

在芯片层面,英伟达2026年CES上亮相的Rubin架构已实现100%全液冷设计,底盘内部彻底取消了风扇,全面采用不锈钢波纹管替代传统EPDM橡胶软管,大冷板模组方案覆盖1颗CPU加2颗GPU的组合,交换机ASIC芯片和光模块也全部纳入液冷覆盖。

在整机层面,所有主流服务器厂商均已推出液冷产品和方案,经过多年迭代产品成熟度大幅提升,从通用节点到AI节点的液冷全覆盖已成现实。

在商业闭环层面,冷板式方案通过2-3年电费节省即可实现投资回收,PUE可降至1.15-1.2,显著低于风冷的1.4。

从市场数据看,IDC数据显示2024年中国液冷服务器市场规模达23.7亿美元,出货量超23万台,2025年有望突破900亿元人民币,2024-2029年年复合增长率达46.8%。应用场景正从互联网、电信向金融、制造、新能源快速延伸,储能和新能源汽车等领域的热管理需求进一步打开了增长天花板。液冷服务器市场中,浪潮、超聚变、宁畅、新华三等传统服务器厂商凭借技术积累、全栈服务能力和产业生态协同的综合优势维持较高份额。

(三)产业生态成型:头部玩家领衔与产业链协同

互联网大厂是液冷落地的先头部队,占据智算需求市场的半壁江山。以阿里、字节跳动为代表的企业已大规模规划液冷智算中心,字节下一代AI训练集群单机柜功率规划达100-240kW,需部署64-256张GPU。围绕字节跳动的液冷需求,已形成涵盖核心模组、浸没技术、IDC集成、服务器供应等多维度的供应链体系,各供应商技术特色鲜明且形成互补生态。运营商为迎合智算需求也在对原有机房进行液冷改造。

海外市场的规模化落地进一步验证了液冷在万卡级集群上的可行性。马斯克的xAI项目与超微合作完成了10万卡H100 GPU的液冷集群建设,Grok 3.0基于该集群训练,实测算力利用率提升22%,故障率下降60%。Google、微软、OpenAI等同样落地了液冷智算中心,从可用性和可靠性层面扫清了国内玩家的顾虑。在国内,以超云为代表的整机柜液冷方案已实现单柜功率密度30-120kW,PUE低至1.2以下,兼容19英寸和21英寸标准机柜,覆盖通用计算和AI计算场景,整机柜液冷覆盖率达80%以上,采用模块化设计可实现工厂预制、快速部署。

三、方案价值

液冷技术正在从数据中心的「可选升级」演变为智算时代不可回避的基础设施革命。它以更低的PUE、更高的单柜密度、更优的芯片运行环境和更低的TCO,为AI算力规模化部署提供了从物理层到系统层的完整支撑。当GPU性能的持续翻倍需要制冷效率同步跃迁,液冷就不再是「加分项」,而是算力基础设施的代际升级,这是一种从空气到液体的冷却范式重构,也是「双碳」目标下数据中心走向绿色高效的核心抓手。

在此环境下,分享一套解决方案:智算中心液冷解决方案值得参考借鉴~

图片
ppt内容如下展示,智算中心液冷技术方案(40页PPT).pptx


图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

图片

点击阅读原文(获取更多数智化解决方案···

【声明】内容源于网络
0
0
鹏博士研究院
内容 3444
粉丝 0
鹏博士研究院
总阅读3.3k
粉丝0
内容3.4k