一个机架能成为支持人工智能的数据中心吗?40千瓦升级指南

分享给

试想一下,在一间老旧的机房里,有一台8千瓦风冷式的传统机架,计划将其改造为一台搭载四台NVIDIA H100服务器的40千瓦直液冷机架。虽然单个机架是基础设施中最小的单元,但对其进行升级会影响到周围的一切。.

本文遵循一条算术链,从40千瓦机架产生的热量,到它所需的水加仑数、电流安培数、地板载荷公斤数和网络端口数。每个答案都引出下一个,而每一个都决定了该机架能否称得上是AI就绪数据中心的一部分。只有当整条链完整之后,“AI就绪数据中心”这样的标签才具有可衡量的意义。这个练习刻意做得很小——一个机架和四台服务器——但它解答了一个关乎整栋建筑的问题。

为什么40千瓦的升级要从热量入手,而不是从功率入手?

功率和热量是同一个数值,因为服务器消耗的每一瓦特都必须以热量的形式散发出去。一个40千瓦的机架会产生136,500 BTU/h的热量,因为每千瓦大约等于3,412 BTU/h,约合11.4制冷吨。 相比之下,一台 8 kW 的风冷机架仅产生 27,300 BTU/h,即 2.3 吨。这一五倍的增幅直接决定了后续所有管道、电路和楼板的尺寸。.

在确定这个数值之前,后续的任何计算都没有意义,这就是为什么在针对机架级AI就绪数据中心的升级中,审计的第一步是热量账本,而不是功耗预算。 简而言之,一个支持AI的数据中心首先是一份热量报告,所有工程决策都以此为依据。无论机架中安装的是四块H100还是八块较小的GPU,这一计算逻辑都成立;唯一变化的是热量账本。.

一个支持人工智能的数据中心机架需要多少冷却液流量?

液冷技术之所以存在,是因为空气无法将40千瓦的热量从狭小空间中带走。流量遵循一个简单的计算公式:热量除以水的比热容及其温度升高值。 以常见的15 K供回水温差为例,40 kW的热负荷需要约0.64升/秒的流量,即大约10加仑/分钟。该流量通过直径为25至40毫米的供回水管输送到冷却液分配单元。 这些数值看似微小,却决定了房间内每根供回水管的直径——这正是“AI就绪型数据中心”在管道系统层面的定义。.

在8 kW风冷系统中,根本不存在水网,因此大多数场馆都忽略了一个关键问题:这些管道是否存在,以及它们可以铺设在何处。 如果缺乏供10 GPM环路水流通的通道,无论机房在纸面上宣称拥有多大的功率,机架的部署都将在这一步搁浅。这就是为什么真正的AI就绪型数据中心要从管道开始,而不是从服务器开始。.

人工智能就绪数据中心

一个支持人工智能的数据中心机架需要多大的电力电路?

该热值现在转换为电流消耗,而大多数老式配电盘无法满足这一需求。在功率因数为0.9的415V三相供电系统中,一个40 kW的机架约消耗62安培。 在老旧建筑中常见的208V三相系统中,同一机柜的电流约为123安培,这需要专用的馈线和更大规格的断路器。这两个数值——62安培和123安培——正是支持AI的数据中心机柜在两种电压下的电气特征。.

以太网联盟(Ethernet Alliance)发布的《2026年白皮书》明确指出,对于新建的人工智能(AI)设施而言,机架供电电压达到415V已不可或缺,而大多数受限于208V电压的工厂无法容纳AI设备。 传统机架通常配备两台额定电流为60或63安培的PDU;而AI机架则需要多台额定电流达100安培及以上的PDU。上游变压器和开关设备也遵循同样的计算逻辑,因此,大多数208V建筑恰恰就在这一环节悄然失去了作为AI就绪型数据中心的资格。.

您的地板能承受一个支持人工智能的数据中心机架的重量吗?

一个40千瓦的机柜不仅发热量大,而且非常沉重。四台H100服务器本身的重量就约为560千克,一旦加上机柜、布线和冷却设备,整个液冷系统的重量将达到800至900千克左右。 在标准的0.6×1.2米占地面积上,这相当于每平方米约1,100公斤。传统的架高地板设计通常额定承重为每平方米450至600公斤,其集中荷载远低于高密度GPU机架产生的荷载。 在人工智能就绪型数据中心的改造中,结构而非服务器,往往是决定性的限制因素。.

选择进行改造的运营商经常发现,结构加固的成本竟然比制冷系统还要高。这是整个链条中的第一步,它更多是财务层面的问题而非物理层面的问题,通常会导致一个已通过水电检测的升级方案最终流产。如果地板在此环节未能通过检测,该机架将无法被认定为“支持人工智能的数据中心”的一部分。.

一个配备AI就绪数据中心的机柜会威胁到周围的机柜吗?

液冷机架仍然会散发热量,只是通过水而非室内空气进行散热,而这些热量必须被转移到某个地方。如果冷却液分配单元将30至40千瓦的热量排入同一机房——而邻近的风冷机架正从该机房吸入空气——那么相邻的服务器吸入的空气温度会升高,从而导致其降频。.

AFCOM的2025年报告显示,目前仅有17%的数据中心采用了液冷技术,另有32%计划在12至24个月内采用,因此混合机房是常态,而非例外。 这种废热确实存在,因为在80%的冷却液对空气热效率下,仍有约8 kW的热量泄漏到机房内。.

从工程角度来看,解决方案是分区:必须通过热通道封闭和独立气流,将液冷机架与风冷机架隔离。 因此,在完全采用风冷的机房内部署单个机架试点项目,不仅仅是一个电气工程项目,因为它会悄无声息地降低同一过道内所有机架的性能。行级分区才是“AI就绪型数据中心”在实践中的真正含义,因为这一标签代表的是整栋建筑的承诺。.

一个机架需要多少个400G端口才能成为真正的AI节点?

机架中的四个 H100 节点各配备八个 400 Gb/s 端口,因此该机架共提供 32 个高速端口。这些端口必须连接到 400G 机架顶部交换机上,通常以冗余对的形式配置两台,上方则连接 400G 或 800G 上行链路。 思科的 AI 基础设施指南中明确描述了这种模式:高基数叶-脊拓扑结构,以及用于集体通信的 RoCEv2。如果没有这些端口资源,任何软件堆栈都无法将机柜视为真正的 AI 就绪数据中心节点。.

存储必须紧邻计算节点,因为检查点写入和数据加载占据了训练时间的大部分。 一个机架即使拥有充足的供电和散热能力,但如果网络已达到饱和状态,就无法用于训练。网络邻接性与散热能力一样,都是人工智能就绪数据中心的必备特性,因为延迟决定了GPU能否始终保持满负荷运行。预先升级网络架构的成本,远低于在训练开始后才发现瓶颈所产生的代价。.

人工智能就绪数据中心

单机架升级的实际成本是多少?值得吗?

将上述各项数据加总后,便不难理解为何“改造”一词会让大多数运营商望而生畏。施耐德电气和Omdia的分析师指出,改造旧有设施极具挑战性,因为其馈线、冷却系统和建筑结构都是为20世纪的负载设计的,而非为GPU集群而建。 他们得出结论:对于许多企业而言,专为数据中心打造的托管设施在经济上更具优势,这也使得“AI就绪数据中心”这一称号在现有设施中难以获得。.

此外,随着未达标指标的增加,改造成本也会随之上升,因为每一项未达标情况都会产生双重成本:一是为解决该问题而产生的工程费用,二是因生产能力损失而产生的成本。.

单机架试点项目仍然可行,但其真正价值在于监测,而非生产。此次升级揭示了该建筑中究竟是哪个阈值(热量、用水、电流、结构或网络)构成了硬性限制。 这些证据可帮助您的团队决定是扩容一个经过优化的机架,还是迁往专门建造的站点。这同时也引发了一些运营层面的问题:谁负责管理和监控水循环系统?当一条流量为10 GPM的管道在$200,000 GPU机架上方发生泄漏时,该如何应对?.

在第一台服务器启动之前,承包商、设施团队和网络人员必须达成一致,而这一结果将决定该建筑是否能够建成一个支持人工智能的数据中心。.

审核机架以确认其是否符合“AI就绪数据中心”状态的正确顺序是什么?

现在,这条链条被简化成了一份有序的检查清单。.

  • 首先,将热负荷值固定为 40 kW。.
  • 其次,将液体回路的流量设计为约10 GPM,并确认管道的实际走向。.
  • 第三,确认有一条额定电流约为62安培、电压为415伏的专用电路,或规划馈线施工。第四,检查地板能否承受800至900千克的机架以及每平方米1,100千克的荷载。.
  • 第五,将机架与旁边的风冷设备隔离。.
  • 第六,为32个400G端口及配套存储设备预留预算。.
  • 第七,将试点项目的定价与托管服务进行对比。.

顺序至关重要,因为一旦出现一个环节失败,后续所有环节都将失效。一个通过全部七项测试的机架,终究只是一个机架,但它是人工智能就绪型数据中心中第一个符合标准的基本单元——可量化、有记录,并且可以机架为单位进行复制。. 

关于作者

加文

加文

Gavin 是一家专门从事数据中心配套设备的公司的运营经理。他精通数据中心专用不间断电源、精密空调和数据中心解决方案。他可以帮助您更好地了解这些产品以及如何选择不同的解决方案。.

相关帖子