Según dos personas familiarizadas con el asunto, Google está desarrollando un nuevo chip de servidor que puede solidificar directamente la arquitectura subyacente del modelo grande Gemini en el hardware del chip, mejorando así en gran medida la eficiencia operativa de la prestación de servicios de IA a los usuarios. Este chip, cuyo nombre en código interno es Frozen v2, está diseñado para resolver la grave escasez actual de potencia informática de IA de Google. La brecha de potencia informática ha provocado conflictos de recursos internos e incluso ha obligado a Google Cloud a rechazar pedidos de cooperación de muchos clientes externos.

Personas familiarizadas con el asunto dijeron que el equipo de I+D calculó que después del lanzamiento oficial del chip, la cantidad de tokens que se pueden procesar por unidad de consumo de energía alcanzará de 6 a 10 veces la de la última generación de chips de IA de desarrollo propio de Google, logrando un salto cualitativo en eficiencia energética.
El origen del nombre en clave "Frozen" proviene de su idea central de diseño: grabar permanentemente parte de la lógica informática del modelo grande en el hardware de silicio. Los ingenieros aún están ultimando los módulos funcionales principales del chip y cómo funcionará cada componente en conjunto. Personas familiarizadas con el asunto dijeron que Google planea implementar el chip ya en 2028.
Project Frozen tiene como objetivo crear una nueva línea de productos de chips de desarrollo propio que complemente los procesadores tensoriales (TPU) existentes de Google, en lugar de reemplazarlos. Los chips de IA más utilizados en la actualidad, NVIDIA GPU y Google TPU, son chips de uso general que se pueden adaptar a una variedad de modelos grandes diferentes. Sin embargo, cuando los chips de uso general ejecutan cualquier modelo, necesitan realizar una gran cantidad de juicios lógicos en tiempo real que consumen mucho tiempo; Frozen v2 tiene directamente una lógica informática subyacente incorporada que se adapta a los modelos de la serie Gemini, lo que puede reducir significativamente los pasos de computación del chip y el volumen de transferencia de datos.
Una de las personas familiarizadas con el asunto dijo que este chip especial puede responder a las preguntas de los usuarios más rápido y se espera que respalde el lanzamiento de nuevos escenarios de aplicaciones de IA por parte de Google. Pero este chip también significa que Google está apostando a que continuará usando la arquitectura subyacente del modelo grande Gemini actual: solo las iteraciones posteriores del modelo Gemini adoptan la misma infraestructura para la cual el chip fue diseñado para funcionar normalmente.
Personas familiarizadas con el asunto agregaron que Google aún puede optimizar iterativamente el chip, incluida la actualización de los pesos del modelo integrado (los pesos son la configuración de parámetros principales que determina cómo el modelo responde a las preguntas).
El portavoz oficial de Google respondió: Los equipos de la compañía "continúan desarrollando y probando diversas tecnologías innovadoras, esforzándose por lograr el máximo rendimiento y eficiencia energética para usuarios y clientes empresariales".
El portavoz añadió: "No todos los proyectos de I+D se pondrán en producción en masa, pero este tipo de exploración tecnológica integral es una parte fundamental de nuestra ruta tecnológica de autoinvestigación completa".
Por qué los chips de inferencia se han convertido en el foco de la industria
Empresas emergentes como Samba Nova y d-Matrix, así como gigantes tecnológicos como OpenAI y Microsoft, están desarrollando chips de inferencia de IA: hardware informático utilizado específicamente para proporcionar servicios externos para modelos grandes. El objetivo de cada empresa es lograr una eficiencia energética de inferencia que supere la de las GPU NVIDIA, aliviar la escasez de potencia informática y reducir los costos operativos. La propia Nvidia también gastó 20.000 millones de dólares en diciembre del año pasado para adquirir la licencia tecnológica del fabricante de chips de inferencia Groq.
Las rutas técnicas de varios actores de la industria son diferentes de la solución Frozen de Google, pero la idea de diseño de Frozen v2 es muy similar a la de la startup canadiense de chips Taalas: este último también optó por codificar la lógica de modelos grandes específicos en el chip. Taalas ha completado más de 200 millones de dólares en financiación, con inversores como Quiet Capital y Fidelity Investments.
La iteración de desarrollo de Frozen v2 proviene de la solución Frozen original. La solución de primera generación está dirigida por Jeff Dean, científico jefe de Google DeepMind, y planea grabar los pesos completos del modelo directamente en el chip. Sin embargo, esta solución tiene desventajas obvias: el chip sólo puede adaptarse a una única versión de Gemini y el ciclo de vida del hardware es extremadamente corto, por lo que ha estado en suspenso durante muchos años.
Otra persona familiarizada con el asunto reveló que Google todavía está sopesando cuánta información del modelo se solidifica en el chip Frozen v2 para equilibrar la flexibilidad del hardware y la eficiencia energética operativa.
El despliegue de chips de desarrollo propio por parte de Google ha dado frutos hasta ahora. Este año, Google lanzó la TPU de octava generación y la promocionó directamente entre los clientes de la nube, lo que impactó directamente la participación de mercado monopólica de Nvidia. Google ha firmado un acuerdo multimillonario con Meta para arrendarle potencia informática de TPU, mientras intenta suministrar TPU a los principales clientes proveedores de nube de Nvidia.
Los chips de IA de desarrollo propio y el no depender completamente de las GPU de Nvidia han ayudado a Google a reducir los costos operativos del modelo Gemini: Google lo adaptó en torno a Gemini al diseñar el TPU, pero la información del modelo integrada en el TPU es mucho menor que la de los chips de la serie Frozen.
Google no tiene planes de producir Frozen v2 en masa por el momento, y la capacidad de producción será mucho menor que la de TPU. Personas familiarizadas con el asunto dijeron que la escala de producción en masa de este chip es limitada y que Google puede posponer la introducción de socios externos de diseño y fundición; Al mismo tiempo, Google considera esta generación de productos como una plataforma de prueba tecnológica. Una vez que se estabilice la arquitectura subyacente del modelo grande, acumulará experiencia en ingeniería para el desarrollo de chips más especializados.