CONTÁCTANOS

Diseño de centros de datos para IA: un plan práctico para clústeres de GPU de más de 100 kW

compartir a:

Diseño de centros de datos de IA ha pasado de ser una tarea de ingeniería de instalaciones a convertirse en una disciplina centrada en el rendimiento informático. Se prevé que el mercado mundial de centros de datos de IA crezca de 236 400 millones de dólares en 2025 a 933 700 millones de dólares en 2030, lo que supone una tasa de crecimiento anual compuesta del 31,61 %, según un análisis publicado en agosto de 2025. Las densidades de rack, que alcanzaban entre 2 y 10 kW en las instalaciones tradicionales, superan ahora los 100 kW en las implementaciones de la clase NVIDIA GB300, y los diseños de referencia para 2025 apuntan hacia racks de 600 kW.

¿En qué se diferencia el diseño de un centro de datos de IA de la planificación convencional de instalaciones?

Las instalaciones convencionales se construyeron pensando en una infraestructura informática predecible y de baja densidad. Los servidores consumían entre 2 y 10 kW por rack, la refrigeración por aire era suficiente y las cadenas de alimentación se dimensionaban con amplios márgenes. Las cargas de trabajo de IA rompen con esos supuestos. Los clústeres de GPU consumen energía en picos intensos que dependen de la carga de trabajo, en lugar de cargas constantes, y generan densidades de calor que los sistemas de climatización no pueden disipar.

Según Vladimir Galabov, director sénior de investigación de Omdia, las implementaciones a hiperescala están experimentando un fuerte aumento de la densidad que lleva la infraestructura de las instalaciones mucho más allá de las normas históricas. Un solo rack de IA de 600 kW puede consumir más electricidad en un par de horas que lo que consume una vivienda familiar media en un mes. En consecuencia, el diseño de los centros de datos de IA ahora dimensiona la potencia, la refrigeración, las redes y la distribución partiendo de la carga de trabajo de las GPU, y no a partir de las normas genéricas de construcción.

¿Qué densidad de potencia debería fijarse como objetivo el diseño de un centro de datos de IA?

La densidad objetivo determina todas las decisiones posteriores, por lo que debe fijarse en función de la hoja de ruta real de las GPU, y no del marketing de los proveedores. La práctica en el diseño de centros de datos de IA se agrupa en torno a tres niveles de densidad. Los racks empresariales tradicionales se mantienen en el rango de 10 a 30 kW, y la Encuesta Global sobre Centros de Datos 2025 del Uptime Institute señala que la mayoría de las instalaciones siguen estando por debajo de los 30 kW por rack. Las fábricas de IA construidas expresamente para este fin se estandarizan en racks de 50 a 100 kW con refrigeración líquida directa al chip.

Las arquitecturas de referencia de NVIDIA para 2025 van un paso más allá y describen armarios de rack con capacidad para más de 500 GPU y un consumo de 600 kW cada uno, lo que supone aproximadamente cinco veces la potencia de los racks de mayor densidad que se utilizan en la actualidad.

Es importante elegir desde el principio un nivel de densidad, ya que la carga estructural, el dimensionamiento de los conductos de alimentación, la capacidad de refrigeración y la distribución del suelo dependen todos de esa cifra. Los diseñadores que planifican para 30 kW y descubren a mitad del proyecto que se necesitan 100 kW se enfrentan a una adaptación mucho más costosa que construirlo bien desde el principio. En el diseño de un centro de datos de IA maduro, cada posición de rack tiene un límite máximo de potencia establecido, que se controla mediante PDU inteligentes y software de gestión de la capacidad.

Diseño de centros de datos de IA

¿Qué arquitectura de refrigeración es la más adecuada para el diseño de un centro de datos de IA?

La refrigeración es el primer subsistema en el que fallan los supuestos tradicionales, y es donde el diseño de los centros de datos de IA se aleja más marcadamente de las prácticas tradicionales. La refrigeración por aire puede soportar aumentos modestos, pero la encuesta del Uptime Institute muestra que el PUE medio apenas ha mejorado durante seis años consecutivos, limitado en parte por la infraestructura heredada. Los racks de IA de alta densidad requieren refrigeración líquida. La refrigeración líquida mediante placas frías abarca aproximadamente el 80% del mercado de la refrigeración líquida, ya que es compatible con las arquitecturas de servidores existentes y ofrece el menor coste total de propiedad.

La refrigeración por inmersión reduce el PUE hasta aproximadamente 1,05, y se prevé que el segmento de la refrigeración por inmersión alcance los 5.8 mil millones de dólares estadounidenses en 2030, con una tasa de crecimiento anual compuesto (CAGR) del 39%. La presión regulatoria acelera el cambio: China exige que los nuevos megacentros de datos construidos a partir de 2025 alcancen un PUE no superior a 1,25, lo que hace que la refrigeración líquida sea, en la práctica, obligatoria. La refrigeración directa al chip es ya un estándar en las implementaciones de IA de alta densidad, y suele coexistir con la refrigeración por aire para los equipos que no son GPU. Cualquier diseño de centro de datos de IA que dependa únicamente del aire para las salas de GPU alcanzará un límite térmico medido en megavatios.

¿Qué arquitectura de suministro de energía admite de forma fiable las cargas de trabajo de IA?

El suministro eléctrico es el subsistema menos visible, pero más costoso, en el diseño de los centros de datos de IA. El consumo de energía de las GPU no es una carga constante, sino que oscila rápidamente a medida que comienzan y terminan las etapas de entrenamiento. La cadena de alimentación debe absorber esas oscilaciones sin activar los dispositivos de protección ni comprometer la estabilidad de la red eléctrica. Los sistemas UPS tradicionales alcanzan una eficiencia del 90-94%, mientras que las arquitecturas de CC de alto voltaje a 800 V alcanzan el 97% o más y reducen los gastos de capital en aproximadamente un 20%. La plataforma GB300 de NVIDIA completa el panorama: los bastidores de alimentación mejorados con almacenamiento de energía redujeron la demanda máxima de la red en un 30% durante el entrenamiento del modelo Megatron LLM.

En el caso de tus propias instalaciones, esto implica especificar estantes de alimentación con almacenamiento en batería integrado, en lugar de transformadores sobredimensionados. Las unidades de batería de respaldo y los paquetes de supercondensadores se están convirtiendo en un estándar a nivel de rack, con tiempos de respuesta inferiores a un milisegundo para la compensación de potencia por impulsos que exige el entrenamiento de las GPU. La sala eléctrica también debe dimensionarse en función del nivel de redundancia que se utilice realmente, y no del nivel Tier III que se declare sobre el papel. Un diseño resiliente de centro de datos de IA aborda la alimentación eléctrica como un problema de control, no como un problema de dimensionamiento.

¿Qué topología de red requieren los clústeres de GPU?

El diseño de los centros de datos de IA falla con mayor frecuencia en la capa de red que en la de alimentación, ya que el entrenamiento distribuido plantea requisitos muy exigentes en cuanto a ancho de banda y latencia. Las redes tradicionales de tipo «leaf-and-spine», optimizadas para el tráfico web norte-sur, no pueden soportar los patrones de tráfico este-oeste propios de la comunicación colectiva. Las tareas de entrenamiento transfieren gradientes, activaciones y estados del optimizador entre las GPU, y la saturación de la red alarga directamente el tiempo de entrenamiento. Los clústeres modernos de GPU separan las redes de escalabilidad vertical y horizontal: la escalabilidad vertical conecta las GPU dentro de un nodo a través de estructuras de gran ancho de banda, como NVLink, mientras que la escalabilidad horizontal conecta los nodos mediante estructuras InfiniBand o Ethernet de 400G/800G.

McKinsey estima que los centros de datos necesitarán un gasto de capital acumulado de 6,7 billones de dólares para 2030 con el fin de satisfacer la demanda de potencia de cálculo, y una parte significativa de ese presupuesto se destina a la infraestructura de conmutación. La regla es: modelar los patrones de comunicación antes de adquirir conmutadores y no permitir nunca que la sobresuscripción de la red se convierta en un cuello de botella oculto. Por lo tanto, el diseño de centros de datos basados en IA debe considerar la arquitectura de red como un elemento fundamental, con ratios de sobresuscripción establecidos explícitamente en cada nivel.

¿Por qué el diseño de los centros de datos de IA da prioridad al «espacio gris» frente al «espacio blanco»?

En los diseños tradicionales de los centros de datos, la mayor parte de la superficie se destinaba al «espacio blanco» (las salas de equipos informáticos), y los equipos de refrigeración y eléctricos se apiñaban en el espacio restante. El diseño de los centros de datos de IA invierte esa proporción. Los racks de GPU de alta densidad exigen un mayor acondicionamiento de la energía, una mayor disipación de calor y una mayor distribución de líquido por metro cuadrado, por lo que el espacio gris destinado a los sistemas de refrigeración y eléctricos ahora rivaliza con el espacio en blanco, o incluso lo supera, en las fábricas de IA construidas expresamente para este fin.

Implicaciones prácticas: pisos estructurales más altos para soportar los circuitos de refrigeración líquida, una mayor carga en las losas para los racks de 600 kW y bloques de alimentación modulares instalados de forma incremental. Si el «espacio gris» se dimensiona de forma insuficiente en la fase de diseño, la instalación se topa con un límite máximo, independientemente del número de racks de GPU que el «espacio blanco» pueda albergar físicamente. Un error habitual en el diseño de centros de datos de IA es copiar los planos de planta heredados y limitarse a sustituir las unidades de refrigeración, lo que no deja espacio para las tuberías, los sistemas de bombeo y la disipación de calor que requiere la refrigeración líquida.

¿Qué pasos hay que seguir a la hora de diseñar un centro de datos de IA?

Una secuencia disciplinada evita los errores más costosos. En primer lugar, define la carga de trabajo objetivo: entrenamiento, inferencia o ambos, ya que el entrenamiento consume muchos recursos de red y almacenamiento, mientras que la inferencia es sensible a la latencia. En segundo lugar, fija la hoja de ruta de las GPU y calcula el nivel de densidad de los racks, la envolvente de potencia y el método de refrigeración para cada sala. En tercer lugar, dimensione la cadena eléctrica en función de la carga máxima con reserva y especifique las plataformas de almacenamiento de energía. En cuarto lugar, diseñe la estructura de red en función de los patrones de comunicación medidos, separando la escalabilidad vertical de la horizontal. Cada una de estas decisiones debe tomarse en la fase inicial de diseño del centro de datos de IA, antes de verter el hormigón.

En quinto lugar, hay que asignar espacio «gris» para la distribución de líquidos, la disipación de calor y las salas eléctricas antes de ultimar la distribución del espacio «blanco». En sexto lugar, hay que verificar el cumplimiento de la norma ASHRAE 90.4, que establece requisitos mínimos de eficiencia para los sistemas de refrigeración y de alimentación eléctrica y que, en sus apéndices de 2022, aborda ahora la informática refrigerada por agua. En séptimo lugar, planifique una implantación gradual, de modo que las primeras salas estén operativas mientras se construyen las siguientes, un modelo cada vez más habitual en el diseño de centros de datos de IA. Seguir esta secuencia permite que todo el proyecto se mantenga alineado con la hoja de ruta informática y evita la trampa de la adaptación posterior.

¿Qué indicadores permiten validar el diseño de un centro de datos de IA?

La calidad del diseño se refleja en indicadores cuantificables, y todo diseño de centro de datos de IA debería evaluarse en función de ellos antes de que comience la construcción. El PUE sigue siendo la métrica de eficiencia más destacada, pero la encuesta del Uptime Institute reveló que una de cada diez interrupciones del servicio sigue causando perturbaciones graves o muy graves, por lo que la ingeniería de disponibilidad merece la misma atención. Es posible alcanzar valores de PUE inferiores a 1,25 con refrigeración líquida, pero para ello es necesario que los componentes de carga mecánica y de pérdidas eléctricas de la norma ASHRAE 90.4 se mantengan dentro de los límites de la zona climática.

La utilización de los racks, medida como el rendimiento informático alcanzado por cada dólar de inversión en activos fijos de las instalaciones, indica si el diseño se adapta realmente a las cargas de trabajo de IA. El tiempo hasta la puesta en marcha —el retraso entre la instalación del rack y el funcionamiento a pleno rendimiento de las GPU— pone de manifiesto los cuellos de botella en el sistema de busway, la refrigeración y la distribución de red.

Conclusión: ¿Cómo debería evolucionar el diseño de los centros de datos de IA en el futuro?

El diseño de centros de datos para IA ya no es una optimización marginal de una plantilla existente, sino una ruptura estructural con tres décadas de prácticas en este ámbito. Los objetivos de densidad, la arquitectura de refrigeración, el suministro eléctrico, la topología de red y la asignación de espacio deben derivarse de la carga de trabajo de las GPU, y el margen de error se mide en millones de dólares de capacidad de cálculo no aprovechada. Las instalaciones que tienen éxito fijan los niveles de densidad desde el principio, estandarizan la refrigeración líquida, protegen la cadena de alimentación y validan sus diseños con datos de ASHRAE y Uptime. Hay que empezar a diseñar el centro de datos de IA partiendo de la carga de trabajo, no del edificio, y el resto encajará por sí solo. 

Sobre el autor

Gavin

Gavin

Gavin es director de operaciones en una empresa especializada en equipos de soporte para centros de datos. Es experto en sistemas de alimentación ininterrumpida específicos para centros de datos, aire acondicionado de precisión y soluciones para centros de datos. Él puede ayudarle a entender mejor estos productos y cómo elegir diferentes soluciones.

Puestos relacionados