多年来,您一直依靠风冷系统运行数据中心。当每台机架的功耗仅为5至8千瓦时,这种方式尚能应付。如今,您的GPU集群每台机架功耗已达40千瓦,而CRAC机组已处于满负荷运转状态。 您并非个例:Uptime Institute 的报告显示,2015 年之前建成的企业级数据中心中,有 68% 的设施缺乏满足现代 AI 工作负载所需的制冷能力。然而,其中 82% 的设施租赁合同仍剩余十余年。您需要一个 服务器的液体冷却 行之有效的改造方案——而且你需要尽快实施。.
为什么空气冷却无法满足您的需求
物理定律是无情的。传统风冷的热阻在每瓦0.5至2.0摄氏度之间——当机架功耗在8至25千瓦时,这种热阻尚可满足需求。 根据 TrendForce 2025 年 8 月的研究报告,如今一台 NVIDIA GB200 NVL72 机架的热设计功耗已达 130 至 140 千瓦。空气根本无法带走如此巨大的热量。.
贵设施的PUE值很可能在1.4到1.6之间,这意味着电费开支中近一半都用于制冷。一旦风冷机架的功率超过25千瓦,您就会遭遇严峻挑战:湍流、热点和风扇故障将急剧增加。 您可能已经注意到,在峰值负载期间服务器会出现降频现象。这些并非异常情况——而是冷却系统已达到其物理极限的表现。这正是服务器液冷技术改变局面之处。.
服务器的液冷技术:三种选择
在评估服务器液冷方案时,主要有三种方案:直接接触芯片的冷板、单相浸没和两相浸没。对于改造项目而言,只有其中一种方案在实际应用中具有可行性。.
直接芯片冷却技术是将金属冷板直接安装在 CPU 和 GPU 上。水-乙二醇混合液在微通道中循环,吸收热量,并将其输送至冷却液分配单元,再由该单元将热量排入设施的水循环系统。 服务器中的其他组件仍采用风冷方式。根据ToneCooling的基准测试,直接芯片冷却的热阻为每瓦0.02至0.10摄氏度,比风冷的性能高出10至20倍。.
单相浸没式冷却是将服务器浸入介电液体中。 两相浸没式冷却采用沸点在50至60摄氏度之间的液体。浸没式冷却可将PUE降至低至1.02,但需要定制储液罐、专用机箱、流体处理规程以及设施改造。对于大多数正在评估服务器液冷方案的运营商而言,浸没式冷却对现有设施的改造影响过大。.
“直接喷射”与“浸没式”:哪种更适合您
“直接芯片冷却”技术在PUE为1.05至1.15时,每机架可支持60至120千瓦的功率;而“浸没式冷却”在PUE为1.01至1.08时,可处理100至250千瓦的功率。从理论上讲,浸没式冷却在能效方面更胜一筹。 但在实际应用中,“直接芯片散热”只需在现有机架上加装冷板、软管和中央冷却单元(CDU)——这些改造工作您的团队几周内即可掌握。而“浸没式冷却”则需要彻底改造机房,向储液罐中注入每升$35至$80浓度的介电液体,并重新培训员工掌握化学品安全知识。.
《冷却报告》在2026年2月指出,直接芯片冷却技术占据了47%的液体冷却市场份额,而浸没式冷却仍处于小众阶段,复合年增长率(CAGR)为25%。 戴尔、惠普企业、联想和超微均提供采用工厂预装式直接芯片冷却技术的标准19英寸机架服务器。浸没式冷却服务器则大多为定制机型。.
就改造项目而言,451 Research 的研究发现,液冷改造方案能够以 20% 的成本,提供相当于新建系统 70% 的性能。 Introl 于 2025 年 12 月发布的一份研究报告显示,某制药公司对一座 2008 年建成的设施进行了改造,安装了 800 块 NVIDIA H100 GPU,成本为 $4.2 百万——而新建设施的成本则高达 $35 百万。 仅需4个月,而非18个月。这就是为什么服务器直冷液冷技术在改造讨论中占据主导地位。.
您的设施是否已做好液冷准备
在订购冷板之前,请评估以下三个因素:电力基础设施、水循环回路容量以及地板承重能力。为服务器添加液体冷却系统通常会使每个机架的重量增加 15 至 25 公斤。大多数额定承重为每机架 800 至 1,200 公斤的架空地板无需加固即可承受这一负荷——但请务必与您的结构工程师确认。.
您的水循环系统是影响最大的变量。CDU会将热量排入您的冷凝水系统。 如果供水温度在10至15摄氏度之间,系统即可正常运行。如果温度更高——这在老旧建筑中很常见——您可能需要一台辅助冷水机组或液-空式CDU。TrendForce证实,液-空式系统之所以成为主流的过渡性架构,正是因为它们能够与现有基础设施兼容。.

电力是第三个需要考虑的因素。每个机架功耗在40至60千瓦的GPU集群,需要相应规格的配电系统。许多2015年前建成的设施,其设计标准是每个机架5至10千瓦。在对服务器进行液冷改造时,应将电力升级与液冷改造一并规划。若只进行其中一项而忽略另一项,将会形成新的瓶颈。.
您的改造路线图
第一阶段:试点。选择两到四个机架,在温度最高的GPU服务器上安装冷板,连接至CDU,并运行30天。监测冷却液进出水温度、压降以及组件温度。在扩大规模之前,需确保系统性能稳定且无泄漏。.
如果在试运行期间遇到流量不稳定的情况,监测工具会捕获回路中的实时热数据,帮助您精确定位压降或热积聚发生的位置。.
第二阶段:扩展为完整的模块。安装配备快速断开接头的机架级汇流排。 据TrendForce报道,CPC、Parker Hannifin、Danfoss和Staubli均为NVIDIA GB200认证供应商。额定插拔循环次数达10,000次的快速断开接头是不可或缺的——它们允许您在无需排空回路的情况下更换服务器。.
第三阶段:全面部署。此时,您的团队应该已经能够熟练掌握冷却液补充、CDU滤芯更换以及泄漏检测等操作。根据《中国液冷服务器市场报告》,冷板解决方案在液冷市场中的营收占比超过80%,因为它们能够与现有操作无缝集成,且无需掌握新的技能。.
服务器液冷系统的成本是多少
根据供应商的基准数据,直接芯片改造的资本成本为每机架 $5,000 至 $15,000。 部署100个机架所需的制冷硬件成本为$500,000至$1.5百万。浸没式冷却仅在储液槽和冷却液方面的成本就高达每机架$20,000至$50,000。.
运营成本的节省扭转了这一局面。将PUE为1.5的空气冷却系统改为PUE为1.2的服务器液冷系统,可将制冷能耗降低30至40%。 一份发布于2026年5月的中国行业改造指南计算得出,一座10 MW的数据中心若将服务器冷却方式从风冷改造为冷板液冷,每年可节省电费约2400万元人民币。即使按最高资本成本计算,投资回收期也远低于24个月。.
第二个好处是:根据热可靠性研究,较低的结温可将 CPU 和 GPU 的使用寿命延长两到三倍。如果您的 GPU 集群价值数百万,那么这种可靠性提升对于您采用服务器液冷技术的商业案例而言至关重要。.
会耗尽预算的错误
省略水系统评估是最代价高昂的错误。如果建筑循环系统无法吸收冷水机组的热负荷,您事后将不得不加装干式冷却器——这不仅会延误工期,还会使预算增加30至50%。在购买硬件之前,请与机械工程师共同对循环系统容量进行建模分析。.
将改造项目单纯视为IT项目是另一个陷阱。服务器的液冷系统涉及设施管理、电气、给排水以及运维等多个方面。如果仅由IT团队单独推进该项目,在调试阶段您就会发现水温高了5度,或者地漏位置不正确。因此,从项目启动之初就应让设施管理和运维部门参与进来。.
忽视冷却液质量是排在前三位的错误之一。乙二醇-水混合物会随时间推移分解成具有腐蚀性的酸,从而侵蚀冷板的微通道。您需要制定过滤计划,并每季度对冷却液成分进行检测。更换一块被腐蚀的冷板所需的费用,远高于安装一套过滤系统的成本。.
服务器液冷技术:您的新常态
一旦完成服务器液冷系统的改造,服务器风扇转速会降低甚至完全停止运转。机房噪音将降低20至30分贝。无论工作负载如何变化,组件温度都能稳定在2至3度的范围内。您的PUE将降至1.2以下,每月电费将减少三分之一。.
您将获得更高的密度余量:一个采用自然对流散热、功率上限为15 kW的机架,现在可承载50至80 kW的功率。您可整合工作负载、释放机房空间,并推迟新建项目。 TrendForce预测,AI数据中心中服务器液冷技术的渗透率将从2024年的14%跃升至2025年的33%,并持续攀升。现在就进行改造升级,能让您抢占先机,而非在竞争对手已完成转型后才手忙脚乱地跟进。.
机遇之窗虽已开启,但正在逐渐关闭。英伟达(NVIDIA)的路线图显示,到2026年将推出600千瓦的机架。未来五年内能够生存下来的数据中心,将是那些在2025年或2026年采用服务器液冷技术的数据中心。贵公司的数据中心理应成为其中之一。.

















