Los procesadores gráficos Blackwell GB300 y GB200 de NVIDIA continúan demostrando un rendimiento líder en diversas cargas de trabajo de inteligencia artificial a través de una optimización técnica continua. A medida que la nueva generación de plataformas de IA continúa implementándose en todo el mundo, es posible que el mundo exterior haya especulado que NVIDIA cambiará su enfoque a la arquitectura Rubin. Sin embargo, resulta que la serie Blackwell, que se ha puesto en práctica en innumerables centros de datos, como la arquitectura Hopper del año, todavía está liberando un potencial sorprendente a través de actualizaciones continuas de software. Entre ellos, el GB300 continúa estableciendo nuevos máximos de rendimiento en tareas informáticas de inteligencia artificial.

Según datos oficiales publicados por NVIDIA, la optimización continua de la plataforma Blackwell ha mejorado enormemente el rendimiento general y la relación de eficiencia energética. En solo 3 meses, NVIDIA aumentó el rendimiento por megavatio hasta 4 veces en la misma configuración GB200 NVL72 ejecutando DeepSeek R1 0528 - cargas de trabajo 1K/1K. Durante este tiempo, la compañía agregó 38 optimizaciones importantes a la plataforma Blackwell ejecutando más de 250.000 configuraciones de simulación y consumiendo un total de 1,4 millones de horas de prueba de GPU. Vale la pena mencionar que más del 90% de los resultados de optimización se pueden aplicar a otros modelos de inteligencia artificial, lo que demuestra plenamente el compromiso de NVIDIA de mantener una profunda inversión en las plataformas de IA existentes a medida que las nuevas plataformas se vuelven más populares.

Por otro lado, la plataforma GB300 "Blackwell Ultra" de NVIDIA sigue dominando el campo del entrenamiento en inteligencia artificial. Al utilizar 256 GPU para ejecutar el modelo DeepSeek-V3 671B, su núcleo Megatron Core estableció un récord sorprendente de 1.648 Terops por GPU, logrando un salto de rendimiento 3 veces mayor en comparación con GB200 606 Terops. El uso de GB300 NVL72 para entrenar previamente DeepSeek-V3 671B puede lograr una eficiencia operativa récord mundial de 1648 Terops por GPU, lo que permite que la misma tarea de entrenamiento alcance un rendimiento determinado con solo una fracción de la escala del hardware. Al mismo tiempo, el rendimiento del mismo sistema GB300 NVL72 también ha aumentado hasta 1,5 veces en los últimos 6 meses después de una optimización continua.

Además, NVIDIA también ha iniciado una cooperación profunda con PyTorch y la comunidad de código abierto JAX para promover la implementación completa de varios resultados de optimización en su matriz de productos de inteligencia artificial. Al ejecutar el modelo DeepSeek-V3 671B utilizando la pila de entrenamiento nativa TorchTitan de PyTorch, el rack Blackwell Ultra logró una mejora de rendimiento de hasta 6 veces sin ninguna optimización inicial. El marco JAX ha logrado un crecimiento aún más significativo. Su velocidad se ha disparado a 1025 Terops por GPU y el rendimiento de una sola GPU puede alcanzar hasta 4082 tokens por segundo. En comparación con la línea de base de enero de este año, ha logrado un salto de rendimiento de 10 veces.

2026-07-22_7-21-04-1.jpg2026-07-22_7-20-55.jpg2026-07-22_7-20-47.jpg2026-07-22_7-20-37.jpgimagen-57.webp

No solo eso, NVIDIA también ha logrado un rendimiento de escalamiento de clase mundial de 256 a 1024 GPU en todos los marcos principales para el entrenamiento previo. Al alcanzar la escala de 1024 GPU, Megatron Core puede mantener una eficiencia de expansión de hasta el 98,5%, mientras que la eficiencia de expansión de TorchTitan y el marco JAX también mantiene un nivel del 97%. El componente principal que respalda este excelente rendimiento de expansión es el chip de red escalable NVIDIA de 800 Gb/s integrado dentro de cada bastidor NVL72. Desde el entrenamiento de modelos hasta la implementación de inferencias, NVIDIA establece constantemente nuevos puntos de referencia en el campo de la inteligencia artificial. Con la plataforma Rubin ya en el mercado y aportando mayores ganancias de rendimiento, otros competidores sin duda enfrentan una presión considerable para ponerse al día.