Resumen:
¿Puedes creer que la primera producción de chips de OpenAI realmente derrotó a toda la serie NVIDIA? ! Justo ahora, el primer chip de desarrollo propio de OpenAI, Jalapeño, entregó el primer lote de resultados medidos: rendimiento de inferencia de IA, superando por completo a NVIDIA GB200 y GB300.


¡Despegue directamente a la velocidad medida!
Jalapeño puede escupir 1459 tokens en un segundo, mientras que Nvidia GB200 solo puede escupir 535 tokens, que es menos de la mitad.
A "Pepper" solo le toma 1,65 segundos completar una tarea, pero a GB300 le toma casi 6 segundos, una diferencia total de 3,6 veces.
Lo más cruel es que incluso si GB300 se ve obligado a alcanzar su velocidad de decodificación más rápida, el rendimiento de Jalapeño sigue siendo 104,3 veces mayor.
El consumo de energía nominal del Jalapeño es de sólo 700W, mientras que el del GB300 es de 1400W, que es exactamente la mitad.
El famoso analista de semiconductores Dylan Patel incluso dijo con dureza: "¡No es sólo Blackwell el que ha sido derrocado, incluso el chip Rubin de Nvidia ha sido superado"!

Durante un tiempo, todo el círculo de IA explotó. Los internautas se maravillaron de que OpenAI fuera tan loco que Nvidia también fuera derrotada.
La declaración de Ultraman fue dominante pero contenida: "¡Hicimos un chip, es ridículamente rápido"!


01
Un "pimiento" derribó el buque insignia de Nvidia
Esto no es OpenAI hablando de sí mismo.
SemiAnalysis fue al laboratorio para realizar mediciones reales y la conclusión que escribieron es——
Jalapeño venció a todos los chips de Nvidia, AMD y Google que habían probado antes.
¿Qué tan grande es la diferencia? La última Vera Rubin de Nvidia consume suficiente electricidad para alimentar a casi tres jalapeños.

Durante la prueba, OpenAI seleccionó tres modelos públicos para ejecutar: GPT-OSS 120B y un modelo 670B y 1T.
Esta ronda de pruebas cubre arquitecturas MoE desde parámetros medianos hasta billones. Los resultados generales son los siguientes:
La carga de trabajo de IA por vatio aumentó entre 1,5 y 1,9 veces
Latencia de un extremo a otro se redujo entre 1,7 y 3,6 veces
Mejora del rendimiento de 2,1 a 4,1 veces en cargas de trabajo altamente interactivas

Los 1459 tokens mencionados anteriormente se midieron en GPT-OSS 120B.
Convertido al intervalo de palabras, solo hay 0,69 milisegundos entre los dos tokens.
Una persona normalmente lee unas cinco o seis palabras en un segundo, pero escupe 1.459 palabras en un segundo. Los ojos no pueden seguir el ritmo y la pantalla no puede leerlos.

El verde es jalapeño, el azul es el más fuerte disponible. Los tres modelos son 2,7 veces, 4,1 veces y 3,8 veces más rápidos respectivamente
La brecha de cuatro segundos entre 1,65 segundos y 5,99 segundos se puede tolerar en el chat, pero es otra cuestión cuando se usa en un agente, porque una tarea requiere docenas de pasos consecutivos, por lo que es necesario multiplicar la diferencia.
Entonces se dijo que toda la red giraba 104,3 veces.
Lo que significa exactamente es que al llevar GB300 a su velocidad de decodificación más rápida, que es de 169 tokens por segundo, en ese punto, el rendimiento de Jalapeño es 104,3 veces mayor.
Esta tendencia es cierta para los tres modelos: GPT-OSS alcanzó 53,7 veces y el modelo 1T alcanzó 56,1 veces.


Para el mismo modelo, a medida que aumenta la velocidad de producción de palabras requerida, el margen inicial aumenta de 1,7 veces a 104,3 veces
En otras palabras, el lugar donde el oponente alcanza el límite y comienza a jadear es exactamente donde todavía navega tranquilamente.
Si los valores máximos se calculan en función de sus respectivos mejores puntos de trabajo, la diferencia será mucho más leve, 1,9 veces, 1,7 veces y 1,5 veces para los tres modelos respectivamente.

Lo que realmente crea distancia es la escena de alta interacción

El eje horizontal de la imagen de la izquierda es la velocidad de salida de palabras y el eje horizontal de la imagen de la derecha es el retraso de la solicitud completa. El Jalapeño verde presiona al GB200 azul en toda la curva
El semianálisis tiene en cuenta el suministro de energía, la disipación de calor y la red, y luego los distribuye a cada chip.
Como resultado, Jalapeño tiene 1,125 kilovatios por unidad, GB200 tiene 1,87 kilovatios y Vera Rubin tiene 3,3 kilovatios.
Al ejecutar GPT-OSS de este calibre, Jalapeño escupe alrededor de 53 millones de tokens por megavatio por segundo, y GB200 NVL72 solo escupe alrededor de 10 millones.

El morado es Jalapeño, el eje horizontal es la velocidad de interacción y el eje vertical es el número de tokens escupidos por megavatio por segundo
En términos de costo, el costo total de propiedad por hora de chip es de $1,56 para Jalapeño, que es casi lo mismo que $1,55 para H100, mientras que Vera Rubin es de $3,61.

El verde es Vera Rubin, el morado es Jalapeño. Después de 200 tokens por segundo, el morado llegó hasta un lugar que estaba fuera del alcance del verde
Lo más terrible es que estos resultados no representan toda la fuerza de Jalapeño.
Ni siquiera permite la decodificación especulativa y la predicción de tokens, ni realiza una implementación separada de prerrelleno y decodificación. Sin embargo, todos los demás chips de la imagen ejecutan su propia configuración óptima y ninguna de las optimizaciones que deberían habilitarse queda fuera.
SemiAnalysis estima que la decodificación especulativa por sí sola puede reducir el costo por token en más de 2/3.

Un jalapeño también puede ejecutar "Doom Slayer"
02
En nueve meses, GPT-Astra trabajó hasta la sala de grabación
Para algo así, solo se necesitaron nueve meses desde el diseño hasta la grabación de OpenAI. En comparación, un plazo común en la industria es de 18 a 36 meses.
Todos los que han realizado ASIC saben que el trabajo más agotador de este ciclo es la verificación. La simulación debe ejecutarse una y otra vez, y si cambias de lugar, tendrás que empezar de nuevo.
La razón por la que OpenAI puede "hacer trampa" es porque invita a su modelo más poderoso a la sala de grabación——
El modelo que ayudó a desarrollar Jalapeño se llama GPT-Astra, ¡que es el GPT-6 del que se rumorea en el mundo exterior!

>
A lo largo de todo el proceso, GPT-Astra básicamente se convirtió en el soporte más fuerte del equipo.
Ayuda a explorar soluciones de implementación, exprime hasta la muerte todo el círculo de "diseño-medición-verificación" y también micromanipula circuitos aritméticos.
¿Hasta qué punto se realiza la microgestión? Las cifras obtenidas por SemiAnalysis son que el diseño asistido por IA reduce el área de la unidad SIMD en un 8% y el área del motor de matriz en un 10%.
Al mismo tiempo, estos módulos son mejores que la primera versión en términos de sincronización y consumo de energía.
>
El chip informático está en el centro, con tres HBM4 a cada lado y el de arriba es el chip de E/S
La matriz de cálculo principal es de aproximadamente 840 milímetros cuadrados y el límite de máscara de la máquina de litografía EUV es de 858 milímetros cuadrados. Esta pieza de silicio está a sólo 18 milímetros cuadrados del techo físico.
Se puede decir que el área donde se puede utilizar la máquina de fotolitografía para dibujar está básicamente ocupada, sin dejar nada en absoluto.
>
La fila rosa es Jalapeño y las tres columnas de la derecha son el ancho de banda por vatio de HBM, los FLOP por vatio y la relación potencia informática/ancho de banda
En términos de ancho de banda por vatio de HBM, Jalapeño tiene 22, el segundo Rubin tiene 11,1 y GB300 tiene solo 5,71. Es exactamente el doble que el segundo lugar.
El FLOP por vatio es 19,1 y el de Rubin es 19,4. Los dos están casi empatados, pero el Rubin quema más de 1.800 vatios, mientras que el Jalapeño sólo quema 700 vatios.
Esto solo se ejecuta con los pasos A0. B0 ya está en la fábrica y su rendimiento por vatio es aproximadamente un 25% mayor que el A0.
De esta manera, basándose en la poderosa combinación de Codex y GPT-Astra, OpenAI transformó tres modelos de código abierto que no estaban originalmente planeados en un estado de alto rendimiento en solo dos meses.
Lo que es aún más aterrador es que en los módulos de “atención” y MoE que requieren más rendimiento, el código escrito por la IA se ejecuta entre 1,5 y 1,8 veces más rápido que los mejores expertos humanos.
La IA diseña el chip, el chip ejecuta la IA y la IA regresa para optimizar la IA en el chip.
Este volante, OpenAI, ya está girando.
>
>
Foso CUDA, ¿muerto?
El foso más profundo de NVIDIA siempre ha sido CUDA.
La pila de software acumulada durante las últimas dos décadas ha cultivado la memoria muscular de ingenieros de todo el mundo. Cada vez que se cambia el hardware, tienen que desmontarlo y empezar de nuevo.
SemiAnalysis hizo un juicio muy severo en el artículo, diciendo que el foso de CUDA puede estar muerto.
>
La razón es la velocidad.
También agregaron una comparación más desgarradora: Rubin de Nvidia en realidad completó la grabación de CoWoS un mes antes que Jalapeño.
Pero hasta ahora, los únicos resultados de Rubin que el mundo exterior puede ver son los datos de las muestras de ingeniería de CoreWeave. Nvidia no coloca a terceros en el laboratorio para realizar pruebas aleatorias como OpenAI.
Entonces el problema radica en la velocidad a la que se inicia el software. No hay nada malo con el hardware de NVIDIA en sí.
Empezar desde cero incluso le da a OpenAI una ventaja. No es necesario llevar equipaje histórico y la arquitectura se puede dibujar completamente en una hoja de papel en blanco.
La última frase de SemiAnálisis es muy gráfica——
Dicen que se han utilizado modelos OpenAI como GPT-5.6 Sol que se ejecutan en GPU NVIDIA para diseñar un chip que realmente amenaza el foso de CUDA. Las propias GPU de NVIDIA están generando sus propios "sucesores" en tiempo real.
>
03
10 gigavatios, esto es sólo el comienzo
El jalapeño es solo el primer disparo en un frente.
En octubre del año pasado, OpenAI y Broadcom dieron un gran paso y firmaron un gran pedido de cooperación para un acelerador personalizado de 10 GW.
>
Chen Fuyang, director ejecutivo de Ultraman y Broadcom, mostró la oblea Jalapeño, con la placa que decía "Procesador de inteligencia Jalapeño"
El nivel de 10 GW es casi equivalente a diez plantas de energía nuclear funcionando a plena capacidad.
>
El gabinete principal de la CPU a la izquierda, el gabinete ASIC a la derecha, 128 chips en un gabinete, el total de los dos gabinetes es de aproximadamente 160 kilovatios
Por cierto, la bandeja que contiene la CPU se llama Katsu, el chip se llama curry indio Vindaloo y el interruptor se llama garbanzos Chana. Desde comida japonesa hasta comida india picante, estas personas realmente quieren que recuerdes este sistema.
Y Jalapeño es solo la primera generación en la hoja de ruta, OpenAI lo indica claramente en el informe——
Gen2 ya está en pleno desarrollo y Gen3 también está tomando forma.
La producción en masa no aumentará gradualmente hasta 2027, y el próximo hito son los 100 megavatios.
>
Sin embargo, hoy mismo se reveló que el administrador del centro de datos de OpenAI, Chris Malone, ¡ya no está!
Malone es el jefe de Stargate.
Ahora, la IPO está cada vez más cerca. En este momento, la pérdida del comandante clave de la infraestructura informática hace que la gente se pregunte sobre el trasfondo detrás de OpenAI.
>
Por supuesto, un Jalapeño no es suficiente para derrocar a Nvidia.
Pero la verdadera señal de peligro es que OpenAI ha convertido modelos, chips y software en un volante acelerador.
El Jalapeño actual es solo la primera generación, seguido por Gen2, Gen3 y un panorama de potencia informática de 10 GW. Incluso si los principales ejecutivos se van, eso no puede impedir que esta ruta siga avanzando.
Nvidia todavía está en el trono.
Solo que esta vez, el reemplazo no se alineó afuera de la puerta, sino que ya había entrado corriendo a la sala de computadoras.
Los rivales de Nvidia finalmente comenzaron a construir su propia Nvidia.
Comentarios