En el proceso de entrenamiento de grandes modelos de inteligencia artificial, la compra de memoria o servicios de supercomputación también se está convirtiendo en una nueva forma de aliviar eficazmente la ansiedad por la potencia informática. Recientemente, Zheng Weimin, académico de la Academia China de Ingeniería y profesor del Departamento de Ciencias de la Computación de la Universidad de Tsinghua, señaló en una comunicación con Sina Technology: "En el pasado, entrenar un modelo grande costaba miles de millones, pero si entrenas un modelo grande en una supercomputadora, el precio es sólo una sexta parte del de NVIDIA".
Además, Zheng Weimin también señaló una nueva tendencia en el desarrollo del razonamiento de IA: el "intercambio basado en depósitos". Tomó como ejemplo el marco tecnológico Mooncake desarrollado conjuntamente por la Universidad de Tsinghua y la empresa AI Unicorn Dark Side of the Moon, e introdujo el principio de cómo esta tecnología se basa en la idea de "depósito a depósito" para ayudar al asistente inteligente kimi de Dark Side of the Moon a aliviar la estricta demanda de potencia informática, evitando así el tiempo de inactividad del servidor.
"Transfiera el entrenamiento de modelos grandes a una supercomputadora, el precio es solo 1/6 del de NVIDIA"
Zheng Weimin vio que después de que las compañías de tecnología globales se pusieran al día rápidamente después del lanzamiento de ChatGPT, los modelos grandes de este año tienen dos características: primero, el modelo grande básico ha entrado en un estado multimodal, no solo texto, sino también imágenes, videos, etc.; en segundo lugar, se utiliza realmente y el modelo grande se está integrando con las condiciones reales de diversas industrias, como modelo grande + finanzas, modelo grande + médico, modelo grande + automóvil, modelo grande + fabricación inteligente, etc.
"Los modelos grandes están muy estrechamente integrados con el PIB de la economía nacional y el nivel de vida de las personas. Siempre he pensado que nuestro nivel de modelos grandes básicos todavía está un poco por detrás del de Estados Unidos, pero en términos de 'Modelo grande+', todavía esperamos superar a Estados Unidos". Dijo Zheng Weimin.
Sin embargo, el proceso de aplicación real de modelos grandes requiere una gran cantidad de recursos informáticos durante todo el ciclo de vida, incluida la adquisición de datos, el preprocesamiento de datos, el entrenamiento del modelo, el ajuste fino del modelo y el razonamiento del modelo. Cómo obtener recursos informáticos de modelos grandes de IA más eficientes y confiables a un costo menor se ha convertido en una cuestión en la que todas las empresas están pensando.
Debido a la dificultad para obtener chips de alta gama en el extranjero, una de las principales soluciones desarrolladas actualmente en China para satisfacer la enorme demanda de potencia informática generada por la capacitación de modelos de IA a gran escala es construir grupos de kilotarjetas y 10,000 tarjetas y comprar chips de múltiples fabricantes a través del apilamiento masivo de chips y semiconductores para la capacitación conjunta de tarjetas heterogéneas para satisfacer la enorme demanda de potencia informática para la capacitación de productos de modelos grandes. Sin embargo, en opinión de Zheng Weimin, aunque este método puede resolver el problema de la escasez de energía informática, también tiene algunas desventajas.
En primer lugar, para construir un sistema Wanka doméstico, es importante construirlo, pero es difícil usarlo bien. Zheng Weimin dijo desde su experiencia personal en informática de alto rendimiento: "Construya un sistema de 2000 tarjetas, 1000 de las cuales usaban chips NVIDIA y las otras 1000 usaban chips de otros fabricantes. El sistema se construyó y funcionó, pero al final se descubrió que el rendimiento de estos chips era diferente y algunos eran menos capaces. Algunos son más capaces. Una tarea se divide en 2000 partes y 1000 de ellas se dividen en tareas más pequeñas y las otras 1000 se dividen en tareas más grandes. Esto sigue siendo estático, si es dinámico, se divide directamente en 2000 partes más pequeñas para su procesamiento y el rendimiento es muy bajo”.
Zheng Weimin señaló que existe un efecto barril en la construcción de grupos informáticos a gran escala. Algunas tarjetas informáticas tienen capacidades sólidas mientras que otras son débiles. Así como la cantidad de agua que puede contener todo el cubo está determinada en última instancia por la tabla corta, es inútil no importa qué tan larga sea la tabla. "Por lo tanto, el rendimiento combinado de 1.000 GPU antiguas y 1.000 GPU nuevas es un poco menor que el rendimiento de 2.000 GPU antiguas, y el costo de construir un clúster informático a gran escala también es bastante alto".
En opinión de Zheng Weimin, es difícil y antieconómico lograr el máximo rendimiento en un entorno estático para el entrenamiento conjunto a gran escala de tarjetas heterogéneas. Será aún más difícil si se trata de tarjetas remotas. Los datos se transmiten de Beijing a Guizhou, y los resultados se producen en Guizhou y luego se envían a Shanghai. El costo de tiempo involucrado es extremadamente alto. "La gente con menos dinero no necesita hacerlo, pero la gente con más dinero puede intentarlo".
Zheng Weimin sugirió que las empresas intenten utilizar la supercomputación para el entrenamiento de modelos grandes de IA. "Hay 1.400 millones de sistemas de supercomputadoras en nuestro país, y el dinero lo paga el estado. Algunas máquinas todavía tienen un pequeño superávit, porque las supercomputadoras nacionales son baratas, a diferencia de NVIDIA, que tiene que recuperar el costo de la máquina y aún así ganar dinero, por lo que todos hacen entrenamiento de modelos a gran escala y van a la supercomputadora Qingdao Sunway, y una sexta parte del precio es suficiente". Dijo Zheng Weimin.
"La conversión de almacenamiento a depósito puede reducir eficazmente los costos de razonamiento de la IA".
De hecho, el proceso de aplicación real de modelos grandes requiere una gran cantidad de recursos informáticos durante todo el ciclo de vida, incluida la adquisición de datos, el preprocesamiento de datos, el entrenamiento del modelo, el ajuste fino del modelo y el razonamiento del modelo. También requiere una gran cantidad de recursos de almacenamiento para almacenar resultados de cálculos masivos. Especialmente en el proceso de inferencia de modelos, cómo almacenar más datos, transmitirlos rápidamente y tener un rendimiento de alto costo se ha convertido en un problema en el que toda la industria está pensando en conjunto.
Anteriormente, Zheng Weimin mencionó públicamente: "El almacenamiento de IA es la base clave para los grandes modelos de inteligencia artificial. El sistema de almacenamiento existe en cada eslabón del ciclo de vida de los modelos grandes y es la base clave para los modelos grandes. Al utilizar el almacenamiento para realizar cálculos y utilizar el almacenamiento para convertir cálculos, el almacenamiento avanzado de IA puede mejorar la disponibilidad de los grupos de entrenamiento, reducir los costos de inferencia y mejorar la experiencia del usuario".
Al comunicarse con Sina Technology, Zheng Weimin compartió el principio básico de "depósito a conversión". Señaló: "Los modelos grandes requieren mucha potencia informática, ya sea para entrenamiento o inferencia, y también requieren mucho almacenamiento para almacenar los parámetros masivos entrenados por el modelo grande, así como algunos datos de proceso generados durante el proceso de inferencia". Sin embargo, si es necesario almacenar más y más datos durante todo el proceso de entrenamiento o inferencia, esto provocará una escasez de recursos de memoria, lo que eventualmente se convertirá en una "carga" para mejorar el rendimiento del modelo grande.
Según Zheng Weimin, para resolver los problemas anteriores, la Universidad de Tsinghua ha pensado en dos métodos: primero, en el proceso de inferencia, actualmente la tarjeta de inferencia funciona principalmente y no se utilizan la CPU y la memoria del host. Por lo tanto, podemos encontrar formas de utilizar la memoria del host en el proceso de inferencia, lo que mejora la utilización de la memoria. Si bien mejora el rendimiento, también ahorra dinero. Se reduce el costo de capital de comprar constantemente tarjetas de inferencia; en segundo lugar, se almacena el contenido común generado durante el proceso de inferencia y compartido por los usuarios. Al almacenar los datos generados durante el proceso de inferencia necesario, se pueden llamar directamente cuando se encuentren problemas similares posteriores, eliminando directamente el proceso de inferencia cada vez que se encuentren problemas similares, mejorando la eficiencia y ahorrando recursos.
Tomando como ejemplo el marco tecnológico Mooncake desarrollado conjuntamente por la Universidad de Tsinghua y Dark Side of the Moon, Zheng Weimin señaló: "Al extraer y almacenar el contenido público de las conversaciones entre diferentes usuarios y Kimi, esto no sólo reduce el proceso de regeneración cada vez que un usuario hace una pregunta, sino que también ahorra muchas tarjetas informáticas y también reduce problemas como el 'retraso de acceso' o el 'tiempo de inactividad' causado por el acceso excesivo a Kimi".
Texto 丨 Tecnología Sina Zhou Wenmeng