联系我们

AI 数据中心设计:100 kW 以上 GPU 集群的实用蓝图

分享给

人工智能数据中心设计 已从一项设施工程工作转变为一项计算性能领域的研究。 根据2025年8月发布的一份分析报告,全球AI数据中心市场规模预计将从2025年的2364亿美元增长至2030年的9337亿美元,复合年增长率(CAGR)为31.6%。 传统设施中机架密度曾达到2-10千瓦,而在NVIDIA GB300级部署中,这一数值现已超过100千瓦,且2025年的参考设计已指向600千瓦的机架。.

为什么人工智能数据中心的设计与传统设施规划有所不同?

传统设施是围绕可预测、低密度的IT架构建造的。服务器每机架功耗为2至10千瓦,风冷即可满足需求,且供电链路的容量设计时预留了充裕的余量。而AI工作负载则打破了这些假设。GPU集群的功耗呈现出剧烈且随工作负载波动的突发式增长,而非稳定负载,且其产生的热密度已超出空气处理系统的散热能力。.

据Omdia高级研究总监弗拉基米尔·加拉博夫(Vladimir Galabov)称,超大规模部署的密度正在急剧增加,这使得设施基础设施远超历史标准。 单个600千瓦的人工智能机架在短短几小时内的耗电量,就可能超过普通家庭一个月的用电量。因此,当前人工智能数据中心的设计已不再依据通用建筑标准向前推导,而是从GPU工作负载倒推来确定供电、制冷、网络和布局的规模。.

人工智能数据中心的设计应以何种功率密度为目标?

目标密度决定了后续的所有决策,因此必须根据实际的GPU路线图来设定,而非依据供应商的营销宣传。AI数据中心的设计实践主要围绕三个密度等级展开。 传统企业机架仍维持在10-30千瓦的范围内,Uptime Institute发布的《2025年全球数据中心调查报告》指出,大多数设施的机架功率仍低于30千瓦。而专为AI打造的数据中心则采用50-100千瓦的机架作为标准配置,并配备直接对芯片的液冷系统。.

英伟达(NVIDIA)的2025年参考架构更进一步,描述了可容纳500多块GPU且每台功耗达600千瓦的机柜,其功耗约为当前在用最高密度机柜的五倍。.

尽早确定密度等级至关重要,因为结构荷载、母线槽规格、制冷能力以及楼层布局都取决于这一数值。如果设计人员最初按30千瓦进行规划,却在项目中期发现实际需求为100千瓦,那么后续的改造成本将远高于一开始就按正确标准进行建设。 在成熟的人工智能数据中心设计中,每个机架位置都有明确规定的功率上限,并通过智能PDU和容量管理软件加以执行。.

人工智能数据中心设计

哪种冷却架构适合人工智能数据中心的设计?

制冷是传统假设首先失效的子系统,也是人工智能数据中心设计与传统做法差异最大的领域。空气冷却虽能支持适度的容量提升,但Uptime Institute的调查显示,平均PUE值已连续六年几乎没有改善,部分原因在于受限于传统基础设施。 高密度AI机架需要液冷技术。冷板液冷技术占据了液冷市场约80%的份额,因为它既能与现有服务器架构兼容,又能提供最低的总体拥有成本。.

浸没式冷却可将PUE降至约1.05,预计到2030年,浸没式冷却市场规模将达到58亿美元,复合年增长率(CAGR)为39%。 监管压力加速了这一转变:中国要求2025年后新建的大型数据中心PUE不得高于1.25,这使得液冷技术实际上成为强制要求。直接芯片冷却现已成为高密度AI部署的标准配置,通常与非GPU设备的空气冷却并存。 任何仅依靠空气冷却的AI数据中心GPU机房设计,都将面临以兆瓦为单位计算的散热上限。.

哪种供电架构能可靠地支持人工智能工作负载?

在人工智能数据中心的设计中,供电系统是最不显眼但成本最高的子系统。GPU的功耗并非恒定负载,而是在训练步骤开始和结束时会快速波动。供电链必须能够吸收这些波动,同时既不触发保护装置,也不影响电网稳定性。 传统UPS系统的效率为90-94%,而800V高压直流架构的效率可达97%或更高,并能将资本支出削减约20%。 英伟达的 GB300 平台进一步印证了这一点:在训练 Megatron 大型语言模型 (LLM) 期间,配备能量存储增强功能的电源机架将电网峰值需求降低了 30%。.

对于您自己的设施而言,这意味着应选用配备集成电池缓冲功能的电源机架,而非尺寸过大的变压器。备用电池单元和超级电容器组正逐渐成为机架级标准配置,其响应时间可控制在1毫秒以内,足以满足GPU训练所需的脉冲功率补偿需求。 机房规模还必须根据实际运行的冗余等级来确定,而不是依据纸面宣称的Tier III认证等级。弹性AI数据中心的设计将供电视为一个控制问题,而非一个规模规划问题。.

GPU 集群需要什么样的网络拓扑?

AI 数据中心的设计在网络层出现故障的频率往往高于供电层,因为分布式训练对带宽和延迟有着极其苛刻的要求。 传统上针对南北向网络流量优化的叶脊网络,无法支撑集体通信所产生的东-西向流量模式。训练任务会在 GPU 之间传输梯度、激活值和优化器状态,而网络饱和会直接延长训练时间。 现代GPU集群将纵向扩展(scale-up)和横向扩展(scale-out)网络区分开来:纵向扩展通过NVLink等高带宽互连架构连接同一节点内的GPU,而横向扩展则通过InfiniBand或400G/800G以太网互连架构连接不同节点。.

麦肯锡估计,到2030年,为满足计算需求,数据中心将需要累计6.7万亿美元的资本支出,其中相当大一部分预算将用于交换基础设施。 基本原则是:在采购交换机之前先建模通信模式,绝不能让网络超额订阅成为隐藏的瓶颈。因此,AI数据中心的设计必须将网络架构视为首要考量,并在每个层级明确设定超额订阅比率。.

为什么人工智能数据中心的设计更重视“灰色空间”而非“白色空间”?

传统数据中心的布局将大部分楼层面积分配给“白空间”(即IT设备机房),而将制冷和电力设备挤进剩余的空间中。人工智能数据中心的设计则颠倒了这一比例。 高密度GPU机架每平方米需要更强的电源调节能力、更强的散热能力以及更完善的液体分布,因此在专门建造的AI数据中心中,用于冷却和电力系统的灰色空间如今已与“白色空间”相当,甚至超过了后者。.

实际影响:需要更高的结构楼板以支撑液体冷却回路,600 kW机架所需的楼板承载力需增强,并需分阶段部署模块化电源模块。如果在设计阶段灰色空间的规划不足,无论白色空间在物理上能容纳多少个GPU机架,该设施都会遇到硬性限制。 人工智能数据中心设计中一个常见的错误是照搬旧有的平面图,仅更换冷却单元,这会导致没有足够的空间来布置液冷系统所需的管道、泵和散热设备。.

设计人工智能数据中心时应遵循哪些步骤?

一套严谨的流程可避免代价最高的错误。首先,明确目标工作负载:训练、推理,还是两者兼有,因为训练对网络和存储资源需求巨大,而推理则对延迟非常敏感。其次,确定 GPU 路线图,并计算每个机房的机架密度等级、功耗预算和冷却方式。 第三,根据带缓冲的峰值负载确定电力链的规格,并指定储能电源架。第四,基于实测的通信模式设计网络架构,将纵向扩展与横向扩展区分开来。所有这些决策都应在AI数据中心的早期设计阶段完成,即在浇筑混凝土之前。.

第五,在最终确定“白色空间”布局之前,应预留“灰色空间”用于液体分配、散热和机房。第六,需根据ASHRAE 90.4标准进行验证,该标准规定了制冷和供电系统的最低能效要求,并在2022年增补条款中新增了对水冷IT设备的相关规定。 第七,规划分阶段部署,以便早期机房投入运营的同时,后续机房正在建设中——这种模式在人工智能数据中心设计中日益普遍。遵循这一顺序,可确保整个项目与计算路线图保持同步,并避免陷入改造困境。.

哪些指标能验证人工智能数据中心的设计?

设计质量体现在可量化的指标上,每个AI数据中心的设计在开工前都应以此为基准进行评估。PUE仍是备受关注的效率指标,但Uptime Institute的调查发现,每发生一次停机,仍会造成严重或极其严重的干扰,因此可用性工程同样值得重视。 采用液冷技术可实现低于1.25的PUE目标,但前提是ASHRAE 90.4标准中的机械负荷部分和电能损耗部分必须保持在气候分区的限值之内。.

机架利用率(以每美元设施资本支出所实现的计算吞吐量来衡量)可以反映该设计是否真正满足了AI工作负载的需求。“上电时间”(即从机架安装到GPU全面运行之间的时间间隔)则能揭示总线通道、散热和网络传输中的瓶颈。.

结论:人工智能数据中心的设计未来应如何演进?

AI数据中心的设计已不再是对现有模板的边缘优化,而是与过去三十年的设施建设实践彻底决裂。密度目标、冷却架构、供电系统、网络拓扑和空间分配都必须基于GPU工作负载来确定,而任何失误都可能导致数百万美元的计算资源闲置。 成功的设施会在早期就锁定密度等级、标准化液冷方案、为供电链预留缓冲,并参照ASHRAE和Uptime的数据进行验证。从工作负载出发而非从建筑出发来设计AI数据中心,其余环节自然水到渠成。. 

关于作者

加文

加文

Gavin 是一家专门从事数据中心配套设备的公司的运营经理。他精通数据中心专用不间断电源、精密空调和数据中心解决方案。他可以帮助您更好地了解这些产品以及如何选择不同的解决方案。.

相关帖子