Resumen:
Intel anunció recientemente más detalles técnicos de su plataforma de procesador de servidor Xeon 7 de próxima generación Diamond Rapids (nombre en código DMR) en la conferencia Hot Chips. Originalmente se planeó lanzar la plataforma en 2026, con una configuración máxima de 192 núcleos y 16 canales de memoria, pero se ha confirmado que se pospondrá hasta 2027. Al mismo tiempo, Intel ha aumentado aún más el número de núcleos de su modelo insignia a 256 núcleos de rendimiento, comparando directamente la serie EPYC Venice de sexta generación de AMD, que también tiene un máximo de 256 núcleos.

A diferencia de los productos anteriores dirigidos al mercado de servidores en general, Diamond Rapids se centrará en la informática de alto rendimiento. Esta plataforma cancela por completo la tecnología Hyper-Threading, que a menudo se denomina multi-threading simultáneo (SMT) en la industria, y solo proporciona versiones AP de alta gama para el mercado de alto núcleo. El producto Diamond Rapids-SP de 8 canales originalmente planeado ha sido cancelado. Por lo tanto, DMR no cubrirá todos los niveles de la línea de productos de AMD, sino que se centrará en competir por el principal mercado de HPC.
Se espera que los siguientes productos Coral Rapids de Intel reintroduzcan la tecnología hyper-threading y puedan traer una nueva generación de procesadores de la serie SP. Sin embargo, en términos de complejidad arquitectónica, Diamond Rapids sigue siendo uno de los procesadores Xeon más sofisticados de Intel hasta la fecha. Hasta cierto punto, su idea de diseño recuerda a la ruta de chiplet modular introducida por AMD con EPYC Rome en 2019: dividir las funciones informáticas, de E/S y de memoria, y luego combinarlas de manera flexible según las diferentes necesidades del producto. Después de explorar varias generaciones de productos, Intel parece haber encontrado finalmente un método de integración multinúcleo que es más adecuado para sí mismo.
Un solo procesador Diamond Rapids puede estar compuesto por hasta 22 núcleos y se puede aumentar o disminuir según las necesidades de potencia informática, capacidad de caché y configuración de memoria. Estos núcleos se dividen principalmente en tres categorías: hasta 16 núcleos informáticos fabricados con el proceso Intel 18A-P, 4 núcleos básicos de componentes informáticos fabricados con el proceso Intel 3-T y 2 núcleos Fabric Hub escalables basados en el proceso Intel 3, que son responsables de conectar varias partes del sistema.

Entre ellos, 18A-P es una versión mejorada del proceso 18A de Intel y pertenece a la tecnología de proceso de nivel 2 nm. Intel afirma que con el mismo rendimiento, este proceso puede reducir el consumo de energía en un 18%; Con el mismo consumo de energía, puede lograr una mejora del rendimiento de hasta un 9%. Además de las mejoras en el proceso, Diamond Rapids también adoptará una nueva microarquitectura central de rendimiento, por lo que el rendimiento real también se verá afectado por las mejoras centrales de IPC.
Cada núcleo informático integra hasta 16 núcleos y su correspondiente caché L2. Hasta cuatro de estos núcleos informáticos se apilarán sobre un núcleo base de bloque de construcción informático utilizando la tecnología de enlace híbrido directo 3D de Foveros. El chip base integra caché L3: cada componente informático proporciona 320 MB de caché L3, y el modelo superior de Diamond Rapids tiene una capacidad total de caché L3 de hasta 1,28 GB.

Intel no utiliza puentes de interconexión multinúcleo integrados EMIB para conectar módulos informáticos con módulos de E/S y de memoria. En cambio, adopta una solución de interconexión de envases más cercana al estilo UCIe-S, que transmite datos a través de un sustrato de envase orgánico en lugar de un puente de silicio. Intel llama a esta nueva arquitectura de matriz una "arquitectura de interconexión en abanico".
Dos chips Fabric Hub escalables integran el controlador de memoria y la interfaz de E/S. Su concepto de diseño es similar al módulo de E/S de las generaciones recientes de procesadores de servidor EPYC de AMD. Al replicar dichos troqueles, Intel puede ampliar los canales de memoria e interconectar capacidades. Dos Fabric Hubs pueden proporcionar un total de hasta 16 canales de memoria DDR5. La velocidad de memoria DDR5 estándar puede alcanzar hasta 8000MT/s, y cuando se utiliza MRDIMM, puede alcanzar 12800MT/s.
En términos de conectividad ampliada, Diamond Rapids admite hasta 128 carriles PCIe 6.0, CXL 3 o UPI 3, además de 8 carriles PCIe 4.0, que pueden usarse para dispositivos de E/S auxiliares, como controladores de administración de red integrada, USB o placa base.

Este diseño también refleja los ajustes de Intel a los métodos de acceso a la memoria. Los Granite Rapids-AP anteriores se presentaban como tres nodos de acceso a memoria no uniforme (NUMA) de forma predeterminada, mientras que Xeon 7 Diamond Rapids espera ofrecer una arquitectura de acceso a memoria unificada (UMA). Debido al nuevo método de interconexión del paquete, el bloque de construcción informático puede comunicarse directamente con dos Fabric Hubs, evitando el problema de acceder a diferentes módulos de E/S mediante saltos adicionales. Intel cree que este diseño no sólo puede ayudar a realizar UMA sino también a controlar el costo del empaquetado avanzado.
Sin embargo, todavía hay muchos parámetros clave de la plataforma DMR que aún no se han anunciado. Intel no ha indicado la frecuencia máxima del núcleo, ni ha revelado la mejora de IPC del nuevo núcleo de rendimiento en comparación con Granite Rapids. Los detalles específicos del nivel de caché también son limitados y actualmente solo se puede confirmar que la capacidad de caché L3 es muy considerable.
En términos de conjunto de instrucciones, Diamond Rapids admitirá las instrucciones de extensión de matriz AMX actualizadas y agregará compatibilidad con FP8 para mejorar la eficiencia de la CPU al ejecutar tareas de aprendizaje automático. El procesador también será uno de los primeros productos en ser totalmente compatible con AVX 10.2. AVX 10.2 tiene como objetivo mejorar algunas limitaciones de la implementación inicial de AVX-512 de Intel y es de gran importancia para aplicaciones de supercomputación y computación de alto rendimiento.
Si bien se espera que UMA se convierta en la configuración predeterminada, la compatibilidad con NUMA sigue siendo fundamental para las cargas de trabajo de HPC que requieren dividir una gran cantidad de núcleos en dominios de recursos más pequeños. Intel aún no ha detallado cómo DMR implementará la partición NUMA, pero desde un punto de vista arquitectónico, el procesador teóricamente se puede dividir en dos, cuatro o incluso más grupos sub-NUMA. La apertura de esta capacidad puede depender principalmente de la configuración del BIOS.

La estratificación del producto es otro problema sin resolver. Actualmente se sabe que Intel lanzará versiones de 256 y 192 núcleos, pero no está claro hasta qué punto se reducirá el número de núcleos. En teoría, Intel puede adaptar el producto a una versión con un solo componente informático y un núcleo informático de 16 núcleos; pero un juicio más realista es que la configuración mínima de Diamond Rapids puede estar entre 64 y 128 núcleos.
A juzgar por las especificaciones publicadas, se espera que Diamond Rapids se convierta en la generación de Xeon de gama alta más competitiva de Intel en los últimos años. Venice EPYC de AMD y DMR de Intel proporcionarán hasta 256 núcleos, 16 canales de memoria, más de 1 GB de caché L3 y capacidades de interconexión similares; También se espera que el consumo de energía del diseño térmico de los productos estrella de ambas partes sea de alrededor de 600 W.
El defecto obvio de Intel es que no cuenta con tecnología Hyper-Threading. En algunas cargas de trabajo que dependen en gran medida de la cantidad de subprocesos, AMD aún puede lograr una ventaja de rendimiento de dos dígitos con SMT incluso si el rendimiento central de ambas partes es similar. Pero en el mundo de la HPC, el hyperthreading no siempre aporta beneficios. Por ejemplo, el punto de referencia HPL, utilizado para clasificar las supercomputadoras en todo el mundo, normalmente no necesariamente se beneficia del hyper-threading. Arm incluso ha declarado antes que el subproceso múltiple sincronizado puede hacer más daño que bien en algunos escenarios.
Esto también le da a Diamond Rapids la posibilidad de ser posicionado por Intel como un procesador sandbox de agente de IA de baja latencia, como un entorno de ejecución de código Python que aloja la generación de IA o un contenedor de aislamiento para compilar y ejecutar código C y Rust. Pero aun así, existe una alta probabilidad de que DMR no se convierta en el producto de gran volumen de Intel, especialmente en el contexto de la promoción por parte de Nvidia de la CPU Vera de desarrollo propio como el procesador del lado host preferido para los sistemas de IA.
En última instancia, el desempeño del mercado de Diamond Rapids seguirá dependiendo del precio y la relación calidad-precio. Cuando AMD lanzó EPYC Rome, tal vez no fuera capaz de abrumar a Intel en rendimiento de un solo núcleo, pero proporcionó un valor de costo unitario más atractivo con su mayor número de núcleos, E/S más rica y mayores capacidades de expansión de memoria. Si Intel puede ofrecer más núcleos a un precio más bajo, Xeon 7 aún puede ser competitivo para ciertos clientes incluso si AMD tiene un mejor rendimiento absoluto.
Comentarios