AI 服务器液冷:为每种部署场景匹配合适的策略

分享给

从空气散热向液体散热的转变,已成为人工智能领域最具决定性的基础设施决策之一。数据中心运营商曾将液体冷却视为超级计算极端场景下的“异类”选择,如今却面临截然不同的现实:英伟达(NVIDIA)、AMD和英特尔(Intel)的GPU发展路线图,已将单机架功耗推高至风扇和气流系统远无法应对的水平。.

匹配合适的 AI服务器液冷 针对每种部署场景的解决方案已不再是理论上的——它决定了人工智能基础设施的投资能否兑现其性能承诺。.

据TrendForce数据显示,人工智能数据中心中液冷技术的渗透率从2024年的14%激增至2025年的33%。AFCOM的2026年报告显示,平均机架密度在一年内从16千瓦攀升至27千瓦。.

据高盛分析,当前AI训练机架的功耗在40至132千瓦之间,而英伟达的Vera Rubin平台正朝着每机架190千瓦的目标迈进,Rubin Ultra Kyber测试机型则计划在2027年左右达到约600千瓦。 风冷技术的实际上限约为每机架30至40千瓦,因此液体散热已成为现代GPU集群的默认选择。如果贵组织正在规划AI基础设施,关键问题不在于是否采用液体冷却,而在于哪种架构能匹配您的工作负载密度。.

物理壁垒:为何空气无法为人工智能降温

液体的传热效率约为空气的3,500倍。传统风冷设施的PUE值通常在1.55至1.67之间,这意味着输入电能中约有三分之一用于支撑基础设施,而非IT设备。 正如Axis Intelligence在2026年7月的制冷经济性分析报告中所指出的,当运营商仅依靠空气为100千瓦的GPU机架进行冷却时,所需的空气流量不仅会对相邻机架造成物理干扰,而且能耗之高更是难以承受。.

相比之下,直接芯片液冷技术通常能将PUE值控制在1.10至1.20左右。施耐德电气报告称,在其适用的应用场景中,直接芯片架构可将制冷能耗降低30%至60%。 对于受固定电力配额限制的运营商而言——据Data Center Dynamics称,目前主要市场的并网排队时间已延长至三至四年——从制冷开销中节省的每兆瓦电力,都能直接转化为可部署的人工智能计算能力。您的现有电力配额将能立即支持多出20%至30%的GPU机架,而无需等待新的电网接入。.

大规模训练:100kW+机架需采用液冷技术

对液冷系统要求最严苛的应用场景是大型训练集群。英伟达的 GB200 NVL72 将 72 块 GPU 和 36 颗 Grace CPU 集成到单机架平台中,功耗约为 120 至 132 千瓦。 GB300 NVL72 将这一数值进一步提升至 132 至 155 千瓦。这些系统产生的热负荷相当于数十户住宅的总和,却集中于一个比停车位还小的占地面积内。.

对于涵盖数百或数千块GPU的训练集群而言,散热挑战愈发严峻。一个采用GB200级硬件、由10,000块GPU组成的部署方案,大约占用140个机架,产生的热量高达16至18兆瓦。 如果没有AI服务器的液冷技术,运营商将面临两种无法接受的后果:要么GPU时钟频率被限制,导致训练时间延长20%至40%;要么过度扩容的空气处理系统消耗的电力甚至超过了计算本身。.

AI 服务器液冷

据Datacentres.com报道,微软在其自2026年1月以来新建的14个区域数据中心集群中部署了浸没式冷却技术。英伟达现将其北美、欧洲和亚太地区的新设施中采用液冷技术作为基础要求——而非升级选项。.

推理集群:持续高吞吐量,无限速

虽然训练备受关注,但推理才是企业人工智能的运营支柱。推理工作负载持续运行,每天处理数千次用户请求。热稳定性不仅关乎峰值性能,更关乎延迟和吞吐量的可预测性。.

在高并发推理场景中,采用风冷时,GPU结温在负载峰值期间可能会波动15至20摄氏度,从而触发时钟频率调整,导致响应时间变差。精密液冷可将结温波动控制在3至5摄氏度以内,从而实现稳定的时钟频率和一致的推理延迟。 CoolIT Systems 指出,这可降低芯片结温的波动性,为长期运行的混合精度工作负载创造可预测的热环境。在运行面向客户的 AI 应用程序时,响应时间的一致性会直接影响用户满意度,而这种热环境的可预测性则能直接保障服务水平协议(SLA)的履行及收入稳定。.

多租户托管服务与混合人工智能工作负载

托管了各类租户的机房必须在不影响现有客户的情况下支持人工智能工作负载。单次高密度的人工智能部署就可能使设计为每机架8至12千瓦的共享制冷系统不堪重负,从而产生热点,导致邻近机架的性能下降。.

2026年2月至7月期间,Equinix在瑞典斯德哥尔摩和哥德堡地区投运了三座高密度AI数据中心,总容量达340兆瓦。这些专为AI打造的数据中心将AI租户划分为液冷区域,同时为标准企业工作负载保留了传统的风冷系统。 通过“直连芯片”液冷技术,机房托管服务商能够为人工智能客户提供每机架50至70千瓦的功率,而无需要求每位租户迁移系统。.

这种混合冷却模式——AI服务器机架采用液体冷却,其余部分采用空气冷却——已成为机房托管运营商进军AI托管领域的普遍模式。如果您计划租赁机房托管空间,在签约前确认该区域是否支持液体冷却,可避免租赁期间因基础设施冲突而造成的高昂损失。.

边缘AI:在空间受限条件下采用液冷技术

边缘部署场景面临着不同的限制。受限于物理空间、缺乏专职设施维护团队以及恶劣的环境条件,传统的风冷机架无法满足高密度人工智能的需求。 精密液冷技术可实现密封、近乎静音的服务器机柜,无论是在办公室、工厂车间还是户外电信机房,都能在避免高速风扇产生的噪音和粉尘污染的情况下正常运行。.

国际能源署预测,到2030年,全球数据中心的用电量将达到约945太瓦时,这主要得益于人工智能的发展。增长的大部分将发生在传统数据中心园区之外,体现在为自动驾驶汽车、工业质量检测和实时视频分析提供推理服务的分布式边缘节点上。.

边缘计算中的液冷技术不仅降低了风扇功耗,据Iceotope称,还可将耗水量减少多达96%,并能保护电子设备免受空气中污染物的侵害——这使得液冷边缘服务器在无法部署传统风冷机架的环境中成为可行方案,同时还能将AI推理部署得更接近数据源,而非通过回传网络进行处理。.

对传统数据中心进行液冷改造

并非每家组织都能从零开始建设人工智能数据中心。那些按每机架5至10千瓦设计能力的现有设施,必须进行改造才能容纳GPU集群——而正是这种改造路径,彰显了液冷技术的灵活性。无需重建整个制冷系统,即可在目标机架区域部署直通芯片的冷却回路。.

关键的改造组件包括冷却液分配单元(CDU),可安装为侧挂式或列内式单元,以及用于处理空气侧残余热量的后门换热器。施耐德电气的分析表明,分阶段进行液冷改造可让运营商逐步完成高功率机架的过渡。.

在纽约州布法罗市TeraWulf的Lake Mariner园区——这是一个将旧工业场地改造利用的棕地项目——集成的供电和液体冷却基础设施支持着预计将达到750兆瓦的分阶段扩建,这证明了现有的电网互联设施可以作为高密度AI部署的基础资产。 如果您的设施拥有闲置的电力容量,但冷却基础设施已日渐老化,那么通过分阶段进行液冷改造,即可开辟GPU托管收入来源,而无需像新建项目那样耗时数年。.

全新构建:从第一天起就采用原生液冷方案

新建的人工智能数据中心建设已形成一种共识:液冷是默认选择。据Datacentres.com数据显示,在全球25,000兆瓦的在建项目中,约60%的超大规模数据中心项目现已强制要求采用浸没式或直接芯片冷却架构。 谷歌和亚马逊云科技(AWS)已在欧洲部署了支持液体冷却的模块化数据中心,而模块化建造方式已将典型50兆瓦设施的绿地项目建设周期从36–42个月压缩至22–26个月。.

针对原生液冷系统进行设计,可实现热能与电力基础设施的集成,从而避免因后期改造导致的效率损失,并支持将余热回收用于区域供热——这正是欧洲法规日益强调的要求。预留液冷接口的基础设施所产生的额外投资成本(预计比传统设计高出8%至12%),可通过设施全生命周期内运营成本降低20%至30%来收回。.

选择合适的人工智能服务器液冷架构

选择合适的架构取决于三个参数:机架功率密度、设施类型和工作负载特征。对于功率低于 40 kW 的机架,混合气液冷却方案已足够。对于 40 至 100 kW 的训练机架,采用行内 CDU 的“直通芯片”冷却方案已成为公认的标准。 当单机架功率超过100 kW时,采用液-液热排的完全液冷方案便成为必要。浸没式冷却可将PUE降至1.05,但初期投资成本较高,因此仅适用于超高密度部署场景。.

在规划液冷AI集群时,尽早评估CDU的容量、冗余度以及与设施接口的兼容性,可避免耗资巨大的重新设计。冷板、快速断开接头和汇流管必须与具体的GPU配置相匹配——这构成了一项挑战 SOETECK 通过集成设备供应来解决这一问题,将冷却视为端到端计算交付堆栈的一部分。.

高盛指出,2027年的人工智能机架设计所需的功耗约为当前互联网服务器机架的50倍,咨询公司预计,未来五年内机架功耗将高达2.2兆瓦。人工智能服务器的液冷技术已从一种小众的差异化优势,转变为任何大规模部署GPU加速计算的组织的基本前提。.

关于作者

加文

加文

Gavin 是一家专门从事数据中心配套设备的公司的运营经理。他精通数据中心专用不间断电源、精密空调和数据中心解决方案。他可以帮助您更好地了解这些产品以及如何选择不同的解决方案。.

相关帖子