Resumen:
Qualcomm anunció recientemente más detalles sobre las capacidades de procesamiento de IA del Snapdragon 8 Elite Gen 6 Pro, el más notable de los cuales es la actualización de la nueva NPU Hexagon. A diferencia de simplemente perseguir el crecimiento de la potencia informática de la IA en el pasado, Qualcomm esta vez presta más atención a la eficiencia de la operación del modelo de IA, el acceso a la memoria y el control del consumo de energía, con la esperanza de permitir que la próxima generación de teléfonos móviles emblemáticos ejecute modelos de IA generativos a mayor escala y agentes de IA a nivel local.

Qualcomm dijo que a medida que la IA generativa se convierte gradualmente en una característica importante de los teléfonos inteligentes, los modelos de IA en sí continúan volviéndose más grandes y complejos. Para los dispositivos móviles, el verdadero cuello de botella no es sólo la potencia informática, sino también cómo procesar eficientemente estos modelos con un consumo de energía y un ancho de banda de memoria limitados. Por tanto, la NPU del Snapdragon 8 Elite Gen 6 Pro ha sido rediseñada en muchos aspectos.
Una de las actualizaciones importantes es el nuevo Element Accelerator. Esta unidad de aceleración de hardware dedicada está optimizada para operaciones específicas en informática de IA, lo que puede mejorar la eficiencia de la NPU al ejecutar cargas de trabajo relacionadas. En comparación con simplemente aumentar la potencia informática máxima de la NPU, este diseño especializado permite que el chip complete tareas específicas de IA con menos recursos, reduciendo así el consumo de energía en el proceso informático.
La nueva generación de Hexagon NPU también obtiene una mayor memoria compartida. Qualcomm dijo que su capacidad de memoria compartida grande ha aumentado un 50% en comparación con la generación anterior. Esta parte de la memoria compartida de alta velocidad permite que la NPU guarde más cómodamente los datos necesarios durante la ejecución del modelo de IA, reduciendo así la necesidad de acceso frecuente a la memoria del sistema.
Este cambio es especialmente importante para modelos de lenguaje grandes. Cuando se ejecuta IA generativa, los modelos necesitan procesar constantemente grandes cantidades de datos contextuales, algunos de los cuales deben persistir durante la inferencia. Si estos datos se transfieren con frecuencia entre la NPU y la memoria del sistema, aumentará la latencia y consumirá más energía. Al agregar memoria compartida de alta velocidad que se puede usar directamente dentro de la NPU, Qualcomm espera reducir este manejo de datos tanto como sea posible.
Uno de los objetos que se ha beneficiado significativamente es KV Cache. A medida que los usuarios mantienen conversaciones continuas cada vez más largas con los asistentes de IA, los modelos necesitan guardar cada vez más información contextual. El tamaño de la caché KV también aumentará en consecuencia y, a menudo, se convierte en una carga de memoria importante cuando se ejecutan modelos grandes localmente. Una memoria compartida más grande permite que datos más relevantes permanezcan más cerca de la unidad informática, mejorando así la eficiencia de la inferencia de la IA.
Qualcomm cree que esta capacidad es particularmente importante para los agentes de IA. En comparación con la IA tradicional de preguntas y respuestas, los agentes de IA deben completar varios pasos de forma continua, como comprender las necesidades del usuario, formular planes de ejecución, llamar a diferentes herramientas, analizar los resultados devueltos y luego pasar al siguiente paso. A lo largo del proceso, el estado y el contexto del modelo deben guardarse continuamente, por lo que reducir el acceso a la memoria puede ayudar a reducir la latencia y permitir que las tareas complejas de IA se ejecuten sin problemas.
Las mejoras de Qualcomm en la NPU también significan que cuando los teléfonos móviles ejecuten IA en el futuro, no necesariamente tendrán que depender simplemente del aumento de la RAM del sistema para resolver el problema. A medida que los modelos locales de IA se hacen cada vez más grandes, los fabricantes de teléfonos móviles han seguido aumentando la capacidad de memoria de sus productos estrella en los últimos años. Sin embargo, aumentar la RAM no sólo aumentará los costos de hardware, sino que también aumentará el consumo de energía y la presión sobre el suministro de memoria. Qualcomm está intentando aliviar este problema a nivel arquitectónico colocando más datos en una memoria compartida de alta velocidad dentro del chip.
Además de la NPU, la CPU y la GPU del Snapdragon 8 Elite Gen 6 Pro también se han actualizado significativamente. Qualcomm reveló anteriormente que la plataforma insignia de nueva generación tendrá una frecuencia de CPU de hasta 5 GHz. Si esta especificación finalmente se implementa según la información anunciada actualmente, se convertirá en un nodo muy simbólico en los procesadores móviles, porque la frecuencia más alta de las CPU de los teléfonos inteligentes entrará oficialmente en la era de los 5 GHz.
Qualcomm también introdujo la tecnología FlexCache para CPU. La idea central también es reducir la dependencia del procesador de la memoria externa del sistema y hacer un uso más flexible del caché interno del chip para que la CPU pueda obtener datos de manera más eficiente. Para los procesadores móviles modernos, la eficiencia del acceso a datos entre el caché y la memoria se ha vuelto cada vez más importante, por lo que este diseño puede mejorar el equilibrio entre rendimiento y eficiencia energética hasta cierto punto.
Las GPU también han experimentado importantes cambios arquitectónicos. Qualcomm describe la nueva generación de GPU Adreno como una actualización arquitectónica muy importante que no solo mejora el rendimiento de los gráficos tradicionales, sino que también mejora aún más la capacidad de la GPU para realizar tareas de IA.
Uno de los cambios importantes es la adición de Adreno Matrix Cores, que son núcleos dedicados a cálculos matriciales. Las operaciones matriciales son un tipo importante de cálculo en los modelos de IA modernos, por lo que los núcleos matriciales dedicados pueden ayudar a las GPU a realizar trabajos relacionados con la IA de manera más eficiente.
Esto significa que las futuras plataformas insignia de Snapdragon no entregarán todos los cálculos de IA a la NPU. Dependiendo de las tareas específicas, la CPU, la GPU y la NPU pueden realizar diferentes tipos de trabajo, formando así un sistema informático heterogéneo más evidente. Para los juegos, la GPU puede realizar parte de los cálculos de IA mientras completa la representación de gráficos tradicionales; mientras que para cargas de trabajo como la IA generativa, la NPU puede desempeñar un papel más importante.
Qualcomm también lanzó la tecnología Adreno Neural Fusion para fortalecer aún más la combinación entre IA y renderizado de gráficos. Esta tecnología puede utilizar algoritmos de IA para mejorar los efectos visuales de las pantallas de juegos y ayudar a lograr efectos de procesamiento de gráficos más avanzados mientras controla el consumo de energía.
Este diseño es particularmente adecuado para tecnologías de gráficos de IA que se han desarrollado rápidamente en los últimos años, como la superresolución y la generación de fotogramas. La resolución y la complejidad de las imágenes de los juegos móviles siguen aumentando. Si todas las imágenes se basan en métodos tradicionales de renderizado nativo, la carga de la GPU y el consumo de energía aumentarán rápidamente. El uso de IA para generar parte de la información de la imagen puede lograr una mayor calidad de imagen final con menores costos de renderizado.
Desde la perspectiva de la arquitectura general, la actualización de IA del Snapdragon 8 Elite Gen 6 Pro no es simplemente hacer que la NPU sea más rápida, sino también intentar rediseñar el método de procesamiento de datos dentro de todo el SoC. La NPU tiene una memoria compartida más grande y aceleradores dedicados. La CPU reduce la dependencia de la memoria del sistema a través de FlexCache, mientras que la GPU agrega capacidades de computación matricial especializada y participa en el procesamiento de gráficos a través de tecnología de inteligencia artificial.
Este cambio refleja que los chips móviles están entrando en una nueva etapa. En el pasado, al medir el rendimiento de los SoC emblemáticos, la gente se centraba principalmente en las puntuaciones de ejecución de la CPU y la GPU, pero ahora la carga de trabajo de IA se ha convertido en un factor importante para determinar la experiencia real del chip. Para la próxima generación de teléfonos móviles, lo realmente importante no es sólo qué tan alta puede ser la potencia informática máxima del chip, sino también si puede ejecutar modelos de IA durante mucho tiempo con un consumo de energía limitado y si puede controlar eficazmente el movimiento de datos entre diferentes unidades informáticas y memorias.
El énfasis especial de Qualcomm en la memoria compartida y la reducción del acceso a la memoria también muestra que la competencia de chips en la era de la IA está pasando gradualmente de una simple "guerra de poder informático" a una "guerra de eficiencia de transferencia de datos". Para los modelos de IA grandes, el cálculo en sí es importante, pero la forma de enviar los parámetros del modelo, el contexto y los resultados intermedios a la unidad informática correcta de manera oportuna también afectará directamente el rendimiento final y el consumo de energía.
Por lo tanto, lo realmente digno de mención del Snapdragon 8 Elite Gen 6 Pro puede no ser cuánto se ha mejorado el rendimiento de la IA individual, sino que Qualcomm está tratando de permitir que los teléfonos móviles manejen tareas de IA cada vez más complejas localmente a través de una colaboración más estrecha entre NPU, CPU, GPU, caché y memoria compartida.
A medida que los asistentes de IA, los agentes de IA, las aplicaciones generativas y las funciones de juegos de IA se convierten gradualmente en una parte importante de los teléfonos móviles emblemáticos, esta idea arquitectónica también puede convertirse en una dirección importante para el desarrollo de SoC móviles en el futuro. En comparación con el aumento continuo de la RAM del sistema, se espera que al digerir los modelos de IA en constante expansión a través de mecanismos de procesamiento de datos y almacenamiento en caché más eficientes dentro del chip se logre un equilibrio más razonable entre rendimiento, consumo de energía y costo.
Será necesario verificar si el Snapdragon 8 Elite Gen 6 Pro puede alcanzar estos objetivos técnicos mediante pruebas completas después de lanzar el dispositivo real. Sin embargo, a juzgar por la información publicada hasta ahora, el objetivo de actualizar la plataforma insignia de Qualcomm de esta generación ha sido muy claro: no solo hacer que los cálculos de IA sean más rápidos, sino también hacer que los cálculos de IA sean más eficientes y minimizar los costos de memoria y consumo de energía de los teléfonos móviles para poder ejecutar la IA local.
Comentarios