Resumen:
XAI, la empresa de inteligencia artificial de Elon Musk, está ampliando aún más la escala de su centro de datos y planea implementar más de 1,2 millones de GPU Nvidia AI en los próximos años. A medida que el centro de datos Colossus continúa expandiéndose, xAI espera entrenar y ejecutar el modelo Grok de próxima generación a través de una infraestructura informática a gran escala y lanzar una competencia de infraestructura de IA más intensa con competidores como OpenAI.

El mayor proyecto de infraestructura de IA actual de xAI es el centro de datos Colossus ubicado en Memphis, Tennessee, EE. UU. La construcción del proyecto comienza en 2024 y la primera fase, Colossus 1, ya está operativa. Musk ha llamado anteriormente a Colossus la "superfábrica de potencia informática" de xAI, cuyo objetivo principal es implementar de forma centralizada una gran cantidad de GPU lo más rápido posible.
Colossus inicialmente utilizó GPU NVIDIA H100. La escala previamente anunciada de la primera fase es de unos 200.000 H100. Con la expansión posterior, el centro de datos comenzó a agregar GPU de la serie Blackwell más avanzadas. La información más reciente muestra que, además del H100 original, Colossus 1 también implementa alrededor de 30.000 Nvidia GB200, por lo que el número actual de GPU en Colossus 1 ha alcanzado alrededor de 230.000.
La segunda fase de xAI, Colossus 2, es aún más grande. El proyecto también está ubicado en Memphis y planea implementar más de 500.000 GPU NVIDIA. Según los planes actuales, Colossus 2 se convertirá en uno de los proyectos de centros de datos de IA más grandes del mundo y su potencia informática superará con creces la de las supercomputadoras tradicionales.
Si se incluyen todos los proyectos de construcción de Colossus 1, Colossus 2 y posteriores, la cantidad de GPU NVIDIA que xAI planea usar en el futuro alcanzará aproximadamente 1,2 millones o más. Este número no significa que se hayan instalado todas estas GPU, sino que corresponde a la escala general de los futuros planes de expansión del centro de datos de xAI.
La expansión radical de xAI en el número de GPU está directamente relacionada con el rápido crecimiento de la demanda de potencia informática para el entrenamiento de modelos de IA. La escala de parámetros, los datos de entrenamiento y el proceso de aprendizaje por refuerzo de los modelos de lenguaje a gran escala requieren cada vez más recursos informáticos, y la potencia informática necesaria para el entrenamiento y la inferencia de modelos está evolucionando desde la escala de los centros de datos tradicionales a la escala de los grupos de supercomputación.
En este caso, tener una gran cantidad de GPU se ha convertido en una base importante para que las empresas de IA amplíen las capacidades de sus modelos. Musk ha enfatizado repetidamente que xAI necesita expandir sus capacidades informáticas lo más rápido posible y reducir su dependencia de plataformas de computación en la nube de terceros mediante la construcción de sus propios grupos de supercomputación.
La velocidad de construcción de Colossus también es una característica importante de la estrategia de infraestructura de xAI. El centro de datos de la primera etapa se renovó sobre la base de una instalación industrial abandonada y xAI lo expandió hasta convertirlo en una instalación de capacitación de inteligencia artificial a gran escala con cientos de miles de GPU en un corto período de tiempo mediante una gran cantidad de equipos prefabricados, construcción paralela y una rápida implementación de GPU.
xAI también continúa ampliando las capacidades de suministro de energía y construcción del centro de datos de Colossus. Debido al consumo de energía extremadamente alto de las GPU de IA modernas, la expansión de los centros de datos no se trata simplemente de aumentar la cantidad de servidores. También deben construir al mismo tiempo una gran cantidad de infraestructura de energía, refrigeración, redes y almacenamiento.
xAI ya se ha enfrentado a problemas de suministro de energía anteriormente. El consumo de energía de Colossus 1 alcanza los cientos de megavatios y, a medida que aumente aún más el número de GPU, sus necesidades de energía también aumentarán significativamente. Para respaldar la expansión posterior, xAI ha estado buscando nuevas fuentes de energía y construyendo la correspondiente infraestructura de generación y distribución de energía.
A medida que NVIDIA Blackwell y las posteriores GPU de la serie Rubin ingresen gradualmente al mercado, el centro de datos de xAI seguirá experimentando actualizaciones de hardware. En comparación con el H100, la nueva generación de GPU puede proporcionar un mayor rendimiento informático de IA, pero el consumo de energía de una sola GPU también está aumentando. Por lo tanto, los futuros grandes centros de datos de IA deben resolver los problemas de densidad informática y suministro de energía al mismo tiempo.
Musk también declaró anteriormente que xAI planea aumentar significativamente la capacidad de energía general del centro de datos alrededor de 2027 y expandir la potencia informática a varias veces su escala anterior. Los planes relevantes muestran que la escala de potencia total de los futuros centros de datos de xAI puede alcanzar varios gigavatios o incluso 10 gigavatios.
Una infraestructura tan enorme significa que xAI está intentando construir una "superfábrica" de IA similar a la de las grandes empresas de computación en la nube. Servidores GPU, equipos de red, sistemas de almacenamiento, instalaciones eléctricas y sistemas de refrigeración líquida se combinarán en un enorme clúster informático para entrenar y ejecutar modelos de IA como Grok.
Esta estrategia también hace que la competencia entre xAI y OpenAI sea cada vez más directa. OpenAI también ha estado construyendo centros de datos de IA a gran escala en los últimos años y ha establecido una asociación de infraestructura a gran escala con NVIDIA. NVIDIA ha anunciado planes para proporcionar a OpenAI al menos 10 GW de sistemas de IA, correspondientes a millones de GPU, y planea invertir gradualmente hasta 100 mil millones de dólares en OpenAI con implementación de infraestructura.
El plan de OpenAI significa que la industria de la IA está entrando en una nueva etapa con los “centros de datos a nivel de gigavatios” como unidad competitiva básica. En el pasado, la competencia entre las empresas de IA se centraba más en los algoritmos, el talento y los datos de los modelos, pero ahora la propia infraestructura informática se ha convertido en un factor importante para determinar la velocidad y la escala del entrenamiento de los modelos.
xAI elige construir su propio centro de datos Colossus a gran escala, lo que permite a la empresa controlar más directamente la implementación de GPU, la estructura de la red, el software del centro de datos y la infraestructura de capacitación. Para las empresas que necesitan entrenar continuamente modelos a gran escala, este enfoque puede reducir la dependencia de plataformas de nube externas y, al mismo tiempo, permitir a los equipos de ingeniería optimizar el hardware y el software para sus propios modelos.
Sin embargo, la escala de 1,2 millones de GPU sigue siendo un objetivo futuro, no la cantidad que xAI ha implementado actualmente. La velocidad de construcción del centro de datos, el suministro de GPU, el suministro de energía, las instalaciones de refrigeración, los equipos de red y la inversión de capital afectarán la velocidad de implementación final. Por lo tanto, la cantidad real de GPU en ejecución y el tiempo de finalización aún pueden variar.
Independientemente de si las cifras finales pueden alcanzar la escala planificada actualmente, el Colossus que está construyendo xAI ha demostrado que la competencia de infraestructura de IA está entrando en una nueva etapa. A medida que OpenAI, Google, Meta, Microsoft y otras empresas de IA construyan centros de datos a nivel de gigavatios, la competencia entre los modelos de IA en el futuro evolucionará en gran medida hacia una competencia entre la escala del centro de datos, el suministro de energía y las capacidades avanzadas de adquisición de GPU.
Comentarios