Resumen:
Algunas empresas líderes en inteligencia artificial están promoviendo la industria de la telefonía móvil para desarrollar dispositivos que puedan ejecutar continuamente 100 mil millones de modelos de lenguaje de gran tamaño con parámetros, con el objetivo previsto para 2028. Sin embargo, esta idea enfrenta dos desafíos prácticos: en primer lugar, ejecutar un modelo tan grande requiere una gran cantidad de memoria y, en segundo lugar, los centros de datos de inteligencia artificial están compitiendo por la capacidad de producción de memoria global, lo que resulta en un suministro limitado de memoria de grado de consumo y aumentos continuos de precios.

Amon, director ejecutivo de Qualcomm, dijo en una entrevista con Fireside Alpha que algunas empresas a la vanguardia de la industria de la inteligencia artificial están explorando teléfonos móviles que puedan ejecutar continuamente cientos de miles de millones de modelos de parámetros. No reveló los nombres específicos de estas empresas, pero declaraciones relevantes muestran que las expectativas de las empresas de inteligencia artificial para los dispositivos móviles están cambiando: en el futuro, los teléfonos móviles pueden ya no ser sólo terminales que ocasionalmente llaman a servicios de IA en la nube, sino dispositivos informáticos personales que pueden ejecutar continuamente grandes modelos localmente y manejar tareas activamente.
Sin embargo, la declaración de Amon trataba más de describir los objetivos propuestos por los clientes de la industria que de la hoja de ruta de productos anunciada oficialmente por Qualcomm. En la actualidad, Qualcomm aún no ha proporcionado una solución de hardware completa que pueda lograr este objetivo en 2028, ni ha prometido lanzar un teléfono móvil comercial con las capacidades correspondientes para entonces.
Desde una perspectiva técnica, el modelo de 100 mil millones de parámetros tiene requisitos mucho más altos para el hardware de los teléfonos móviles que los modelos de IA actualmente comunes en los dispositivos. Los parámetros de un modelo de lenguaje grande determinan la gran cantidad de valores que el modelo necesita guardar y llamar, y estos datos generalmente deben almacenarse en la memoria para que el procesador pueda acceder a ellos rápidamente durante la inferencia.
Tomemos como ejemplo un modelo con 100 mil millones de parámetros. Si se utiliza la cuantificación de 4 bits, cada parámetro teóricamente solo requiere 4 bits de almacenamiento, por lo que solo los parámetros del modelo requieren aproximadamente 50 GB de memoria. En la operación real, también se debe reservar espacio para el sistema operativo, otras aplicaciones, caché de contexto y datos temporales durante la inferencia. Por lo tanto, 50 GB no es la capacidad de memoria total que requiere un teléfono móvil para ejecutar el modelo sin problemas.
Si el modelo se cuantifica aún más a 2 bits, cada parámetro solo requiere 2 bits y el requisito de almacenamiento teórico para los parámetros del modelo se puede reducir a aproximadamente 25 GB. Sin embargo, esta solución aún requiere que los teléfonos móviles tengan una capacidad de memoria muy superior a la de los productos convencionales actuales, y la cuantificación de precisión extremadamente baja puede dañar significativamente la calidad de salida del modelo, especialmente en tareas de inferencia complejas.
Cabe señalar que la cantidad de parámetros no determina directamente todas las capacidades del modelo. Los datos de entrenamiento, la arquitectura, los métodos de entrenamiento y las técnicas de inferencia de diferentes modelos afectarán el rendimiento final. Es completamente posible que un modelo pequeño y optimizado supere a un modelo más grande en una tarea específica. Por lo tanto, incluso si el teléfono móvil no puede ejecutar directamente el modelo de 100 mil millones de parámetros por el momento, eso no significa que no pueda proporcionar una experiencia de uso real cercana a la de un modelo grande.
Actualmente, todavía existe una clara brecha entre la configuración de memoria de los teléfonos inteligentes y la capacidad requerida por cientos de miles de millones de modelos de parámetros. En el pasado, algunos teléfonos insignia de Android alguna vez ofrecieron 24 GB de memoria LPDDR5X. Sin embargo, con la escasez de memoria y el aumento de los precios, los fabricantes de teléfonos móviles comenzaron a reevaluar el valor comercial de las versiones con mucha memoria. Para los consumidores comunes, aumentar la capacidad de la memoria significa mayores costos de hardware, y es difícil para los fabricantes de teléfonos móviles determinar si los usuarios están dispuestos a pagar más por ejecutar modelos locales de IA más grandes.
Esto crea una contradicción: las empresas de inteligencia artificial esperan que los teléfonos móviles tengan capacidades informáticas locales cada vez más potentes, pero la memoria necesaria para lograr este objetivo es cada vez más cara y difícil de obtener.
El suministro global de memoria es escaso, lo que está estrechamente relacionado con la rápida expansión de los centros de datos de inteligencia artificial. Las grandes empresas de tecnología siguen invirtiendo en servidores de IA, que requieren grandes cantidades de DRAM, memoria de gran ancho de banda y dispositivos de almacenamiento de alta velocidad. Los fabricantes de memorias también están prestando cada vez más atención a los productos relacionados con la inteligencia artificial con una fuerte demanda y mayores ganancias a la hora de organizar la producción. Por lo tanto, la memoria tradicional necesaria para los equipos electrónicos de consumo se encuentra bajo presión de oferta.
Aunque la DRAM de bajo consumo utilizada en los teléfonos inteligentes y la memoria de gran ancho de banda utilizada en los aceleradores de IA son diferentes en cuanto a la estructura del producto y los requisitos de fabricación, todavía se ven afectadas por los cambios en la asignación de capacidad de producción y la oferta y demanda del mercado en toda la industria de semiconductores. Cuanto mayor sea la demanda de memoria de la infraestructura de IA, más difícil será para los fabricantes de productos electrónicos de consumo mantener las condiciones anteriores en términos de precio y oferta.
Esta presión se ha reflejado en los costes de fabricación de teléfonos móviles. Un análisis publicado anteriormente por la firma de investigación de mercado Counterpoint Research mostró que en el segundo trimestre de 2026, los precios de la memoria de los teléfonos inteligentes aumentaron más del 80% con respecto al trimestre anterior. Entre los teléfonos móviles de diferentes precios, el aumento de los costes de la memoria tiene un impacto significativo en los costes generales de los materiales.
Counterpoint señaló que el costo de la lista de materiales de los teléfonos móviles de gama media aumentó aproximadamente un 52 % año tras año, y la memoria representó aproximadamente el 40 % del costo total de la lista de materiales. Los teléfonos móviles de gama alta también se han visto afectados, y la DRAM incluso ha superado a los chips a nivel de sistema para convertirse en el componente individual más caro de algunos teléfonos móviles emblemáticos.
Esto significa que los fabricantes de teléfonos móviles no sólo deben considerar si tienen la capacidad de configurar 50 GB o más de memoria para modelos con 100 mil millones de parámetros, sino que también deben responder a una pregunta más realista: ¿están los consumidores dispuestos a pagar por estas memorias?
Si solo se utilizan modelos grandes, la memoria del teléfono móvil debe aumentarse de los 12 GB o 16 GB actualmente comunes a 64 GB o incluso más, y el costo de toda la máquina puede aumentar significativamente. Sumado a procesadores más potentes, empaques y diseños térmicos avanzados, el precio del producto final puede estar más alejado del rango aceptable para los consumidores comunes.
Qualcomm y Apple están intentando aliviar este problema en términos de arquitectura de chip y tecnología de empaquetado. Informes relacionados mencionaron que Apple A20 Pro y la plataforma insignia Snapdragon de nueva generación de Qualcomm están explorando diseños de chips y métodos de organización de memoria que sean más propicios para el funcionamiento de modelos grandes, con la esperanza de mejorar la eficiencia del acceso a datos y reducir la sobrecarga de transmisión de datos entre el procesador y la memoria.
Sin embargo, mejorar la eficiencia de la encapsulación y el acceso a los datos no significa que los requisitos de memoria física desaparecerán automáticamente. Incluso si el procesador puede utilizar la memoria de manera más eficiente, el modelo de 100 mil millones de parámetros aún necesita guardar una gran cantidad de datos de parámetros. Para que los modelos de esta escala sean realmente adaptables a los teléfonos móviles, es posible que la industria necesite lograr más avances en la compresión de modelos, la arquitectura de inferencia y el acceso al almacenamiento.
Una posible solución es una tecnología de cuantificación más radical. Al reducir la cantidad de bits utilizados por parámetro, el modelo puede ejecutarse en un espacio de memoria más pequeño. Sin embargo, la cuantificación no está exenta de costes. Para tareas que requieren un razonamiento lógico complejo, una precisión numérica demasiado baja puede provocar una degradación significativa del rendimiento del modelo. Por lo tanto, cómo lograr un equilibrio entre el uso de la memoria y la calidad del modelo se convertirá en una dirección de investigación importante para la IA final.
Otra solución es el modelo experto híbrido, que es la arquitectura MoE. A diferencia de las arquitecturas intensivas tradicionales que requieren llamar al modelo completo para cada inferencia, el modelo MoE selecciona parte de la red de expertos para participar en cálculos basados en tareas específicas. Con un diseño adecuado, solo es necesario activar un pequeño conjunto de parámetros en el modelo cada vez que se procesa un token.
Si se adopta más la tecnología de descarga de expertos, el sistema puede retener a los expertos que se necesitan actualmente en la DRAM y almacenar temporalmente a los expertos que no se necesitan en la memoria flash. Cuando se necesitan otros expertos para el proceso de inferencia, los datos relevantes se leen de una memoria flash a otra.
Este enfoque puede reducir la cantidad de datos que el modelo debe residir en la DRAM al mismo tiempo, pero a expensas de un mayor acceso al almacenamiento y gastos generales de transferencia de datos. Las características de velocidad de acceso y latencia de la memoria flash UFS utilizada en los teléfonos móviles son significativamente diferentes de las de la DRAM. Si el modelo lee parámetros de la memoria flash con frecuencia, la velocidad de inferencia puede verse afectada.
Apple también ha estudiado previamente la solución de utilizar el almacenamiento integrado del dispositivo para ejecutar modelos de lenguaje de gran tamaño. Se espera que este tipo de tecnología reduzca la dependencia de la capacidad de DRAM, pero aún es necesario verificar más a fondo si puede lograr una latencia suficientemente baja, un alto rendimiento y un consumo de energía aceptable en los teléfonos móviles.
Además, el funcionamiento continuo de modelos grandes también provocará problemas de disipación de calor y duración de la batería. El espacio interno de los teléfonos móviles es limitado y no pueden equiparse con sistemas de refrigeración a gran escala como ordenadores de sobremesa o servidores. Si el procesador realiza inferencias de IA de alta intensidad durante mucho tiempo, la temperatura del chip puede continuar aumentando, lo que posteriormente activa el mecanismo de reducción de frecuencia, lo que resulta en una degradación del rendimiento.
Este problema es particularmente grave para los agentes que necesitan operar las 24 horas del día. Los chatbots tradicionales generalmente comienzan a procesar tareas después de que el usuario realiza una solicitud, pero la nueva generación de agentes de IA puede necesitar monitorear continuamente la información, analizar el contexto y realizar operaciones de manera proactiva en el momento adecuado. Si el teléfono debe ejecutar modelos grandes las 24 horas del día, no sólo la memoria debe estar disponible en todo momento, sino que también se debe controlar estrictamente el consumo de energía del procesador y el consumo de batería.
Por lo tanto, incluso si un futuro teléfono móvil puede cargar con éxito un modelo de 100 mil millones de parámetros, eso no significa que pueda continuar funcionando a la velocidad ideal. Si el modelo realmente puede residir en la memoria, cuántas palabras puede procesar por segundo, cuánto calor genera durante el funcionamiento y cuánto impacto tiene en la duración de la batería son indicadores importantes para medir el valor de uso real.
En comparación con conectar directamente un modelo de 100 mil millones de parámetros a un teléfono móvil, una solución más realista puede ser ejecutar un modelo de tamaño mediano destilado y optimizado.
La destilación de modelos generalmente aprovecha las capacidades de un modelo grande para entrenar un modelo más pequeño, de modo que este último pueda retener el rendimiento del modelo grande en una tarea específica tanto como sea posible mientras la escala de parámetros se reduce significativamente. Wccftech cree que un modelo de 20 mil millones a 30 mil millones de parámetros adecuadamente destilado puede acercarse al rendimiento de un modelo de 100 mil millones de parámetros en ciertas tareas y, por lo tanto, es más adecuado para convertirse en la fuerza principal de la IA local en los futuros teléfonos inteligentes.
La ventaja de esta solución es que no tiene que depender de una capacidad de memoria extremadamente grande y tiene la oportunidad de proporcionar capacidades de razonamiento bastante potentes. Para los fabricantes de teléfonos móviles, en lugar de simplemente buscar cuántos parámetros se pueden acomodar, es mejor lograr una mejor experiencia real con recursos de hardware limitados a través de la arquitectura del modelo, la cuantificación, la destilación y la optimización de la inferencia.
Por supuesto, el rendimiento de los diferentes modelos varía mucho y un modelo de 20 a 30 mil millones de parámetros no puede reemplazar al modelo de 100 mil millones de parámetros en todas las tareas. Capacidades como el razonamiento complejo, la experiencia y el procesamiento de contextos prolongados aún dependen de la capacitación y el diseño de la arquitectura de modelos específicos. Pero desde una perspectiva de productización, poder completar la mayoría de las tareas diarias con un consumo de energía y un costo razonables puede ser más valioso que buscar una escala de parámetros pura.
La declaración del CEO de Qualcomm también refleja que la industria de los teléfonos inteligentes está buscando nuevas direcciones de crecimiento. A medida que los beneficios marginales de las actualizaciones de hardware tradicionales disminuyen gradualmente, los fabricantes de teléfonos móviles esperan utilizar agentes de inteligencia artificial para redefinir cómo se utilizan los dispositivos.
Es posible que los futuros teléfonos inteligentes ya no sean simplemente dispositivos que esperan a que los usuarios abran aplicaciones e ingresen comandos, sino más bien asistentes personales que puedan comprender continuamente las necesidades, organizar tareas y llamar a diferentes servicios dentro del alcance de la autorización del usuario. Dichos sistemas requieren capacidades de razonamiento local más sólidas, así como una gestión de memoria más eficiente, computación de bajo consumo y mecanismos de seguridad.
Sin embargo, todavía existe una distancia entre los objetivos de la industria y el producto final. Amon no anunció el nombre de la empresa asociada específica, ni proporcionó una hoja de ruta completa del hardware ni un cronograma de producción en masa. Es más adecuado entender 2028 como el plazo objetivo en el que algunas empresas de inteligencia artificial esperan lograr esta capacidad, en lugar de la fecha de lanzamiento del producto que Qualcomm ha confirmado.
A juzgar por las condiciones técnicas actuales, no es completamente imposible que los teléfonos móviles ejecuten cientos de miles de millones de modelos de parámetros en 2028, pero el método de implementación puede ser diferente de lo que la gente imagina "cargando todos los modelos completos en la memoria del teléfono móvil". Una cuantificación más agresiva, una arquitectura MoE, una descarga experta, un diseño de memoria dedicada y una destilación de modelos pueden ser parte del logro del objetivo.
Al mismo tiempo, la oferta global de memoria y las tendencias de precios afectarán directamente la viabilidad comercial de esta dirección. Si los centros de datos de IA limitan el suministro de DRAM de consumo durante mucho tiempo, incluso si es técnicamente posible fabricar teléfonos móviles con 64 GB o más de memoria, es posible que los fabricantes no estén dispuestos a lanzar dichos productos a gran escala.
Por lo tanto, la visión de Qualcomm de un teléfono móvil con 100 mil millones de parámetros realmente debe resolverse no sólo en términos de rendimiento del chip, sino también en el equilibrio integral entre el tamaño del modelo, la capacidad de memoria, el costo de fabricación, la disipación de calor, la duración de la batería y la demanda de los consumidores. Para los usuarios comunes, lo más notable en el futuro puede no ser si el teléfono móvil puede ejecutar un modelo con 100 mil millones de parámetros, sino si puede proporcionar servicios locales de IA confiables, rápidos y verdaderamente útiles sin aumentar significativamente el precio ni sacrificar seriamente la duración de la batería.
Comentarios