Resumen:
Según el analista de cadena de suministro Ming-Chi Kuo, el proyecto de acelerador de IA “Rubin CPX” de NVIDIA, anteriormente archivado, se ha reiniciado y se ha rediseñado la arquitectura de la memoria. Originalmente se planeó que este producto estuviera equipado con una memoria de video GDDR7 de 128 GB, pero ahora está equipado con una memoria de alto ancho de banda HBM4 de 168 GB.

Nvidia anunció a finales del año pasado que planeaba desarrollar un acelerador dedicado basado en la familia de GPU Rubin, principalmente para cargas de trabajo de inteligencia artificial de agentes a gran escala. Después de que se anunció el proyecto, se informó que se archivó temporalmente, pero Nvidia parece haber completado la replanificación. Rubin CPX se implementará en bastidores independientes; cada bastidor se puede configurar con entre 64 y 256 GPU CPX independientes.
A diferencia de las GPU Rubin convencionales responsables de las tareas de decodificación, las GPU CPX se utilizan principalmente para la etapa de "relleno previo" en el proceso de inferencia de modelos de lenguaje grandes y son responsables de procesar el contexto de entrada y el caché KV. NVIDIA está tratando de separar las tareas de precarga y decodificación, con la GPU CPX encargándose del trabajo de precarga y luego la GPU Rubin normal encargándose de la decodificación, mejorando así la eficiencia general de inferencia.
Una bandeja de rack equipada con 8 GPU CPX puede manejar hasta 1,34 TB de datos de llenado previo de contexto largo y caché KV relacionada, todo ello basándose en la memoria HBM4. HBM4 puede proporcionar un mayor ancho de banda de memoria, lo que ayuda a acelerar el procesamiento de datos de contexto largos. Dado que el diseño anterior no requería HBM4 integrado, Nvidia también debe rediseñar el empaque del chip y se espera que utilice la tecnología de empaque avanzado CoWoS-S o CoWoS-L de TSMC.
En términos de rendimiento informático, Rubin CPX adopta un diseño de chip monolítico y puede proporcionar 30 gigaflops de rendimiento informático NVFP4, o 30 PFLOPS. El chip también integra 4 motores de codificación de video NVENC y 4 motores de decodificación de video NVDEC, lo que le permite completar cargas de trabajo relacionadas con multimedia más eficientes sin depender de procesadores externos.
A medida que la escala de parámetros de los modelos de lenguaje grandes se acerca al nivel de billones, se espera que la entrega de tareas de precarga y decodificación a diferentes racks aumente significativamente la velocidad de generación y entrega de tokens. Nvidia también recomienda mantener una proporción de 1:1 entre GPU CPX y GPU Rubin normales en el bastidor de decodificación.
Comentarios