En enero de 2025, se lanzó DeepSeek-R1. En este momento, en el primer aniversario del lanzamiento del modelo R1, se expuso el nuevo modelo "MODEL1" de DeepSeek. El 21 de enero, hora de Beijing, el repositorio oficial de GitHub de DeepSeek actualizó una serie de códigos FlashMLA. Con la ayuda de la IA, se analizó el número total de archivos de código: 114 (incluidos archivos .py, .md, .txt, .sh, .cpp, .cu, .h) y se descubrió un identificador de arquitectura de modelo no revelado anteriormente, "MODEL1", que se mencionó 31 veces en total.

FlashMLA es la herramienta de software original de DeepSeek que está profundamente optimizada para las GPU con arquitectura NVIDIA Hopper y está diseñada específicamente para acelerar la "generación de inferencia" de modelos grandes. La implementación de este algoritmo se basa en MLA (mecanismo de atención multicapa), que es una de las tecnologías clave para que los modelos DeepSeek (como V2 y V3) logren un bajo costo y un alto rendimiento. Se utiliza para reducir el uso de memoria a nivel de arquitectura del modelo y maximizar el uso del hardware GPU.
MODEL1 es una de las dos arquitecturas de modelo principales admitidas en DeepSeek FlashMLA, la otra es DeepSeek-V3.2. Se especula queEs probable que MODEL1 sea un modelo de inferencia eficiente. En comparación con V3.2, tiene un menor uso de memoria y es adecuado para dispositivos periféricos o escenarios sensibles a los costos. También podría ser un experto en secuencias largas., optimizado para secuencias de más de 16.000, adecuado para tareas de contexto largas, como comprensión de documentos y análisis de código. También puede ser un especialista en secuencias largas, optimizado para secuencias de más de 16K,Adecuado para tareas de contexto prolongado, como comprensión de documentos y análisis de código..
Además, la implementación de hardware de MODEL1 abarca múltiples arquitecturas de GPU. Hay dos versiones de NVIDIA H100/H200 (arquitectura SM90): model1_persistent_h64.cu se usa para la configuración de 64 cabezales y model1_persistent_h128.cu se usa para la configuración de 128 cabezales. Hay una implementación de kernel Head64 dedicada en el último B200 (arquitectura SM100), y la implementación Head128 de SM100 solo admite MODEL1 y no admite V3.2.Algunas personas especulan que DeepSeek ha optimizado especialmente la arquitectura de MODEL1 para adaptarse a la nueva generación de GPU de NVIDIA..
Los principales modelos que DeepSeek ha lanzado son representantes de dos líneas técnicas: el "asistente integral" de la serie V que busca el máximo rendimiento integral y el "solucionador de problemas" de la serie R que se centra en el razonamiento complejo.
La V3, lanzada en diciembre de 2024, es un hito importante para DeepSeek. Su eficiente arquitectura MoE ha establecido una sólida base de rendimiento integral. Desde entonces, DeepSeek ha iterado rápidamente en V3, lanzó V3.1 para fortalecer el razonamiento y las capacidades del agente, y lanzó la última versión oficial V3.2 en diciembre de 2025. Al mismo tiempo, también se lanzó una versión especial V3.2-Speciale enfocada en resolver problemas matemáticos y académicos difíciles.
R1, lanzado en enero de 2025, utiliza el aprendizaje por refuerzo para desempeñarse de manera sobresaliente en tareas de razonamiento complejas, como la resolución de problemas matemáticos y la programación de códigos, y fue pionero en el modo de "pensamiento profundo".
El medio tecnológico The Information dio la noticia a principios de mes de que,DeepSeek lanzará una nueva generación de modelo insignia de IA: DeepSeek V4 durante el Año Nuevo Lunar a mediados de febrero de este año, que tendrá capacidades de codificación más sólidas..
Anteriormente, el equipo de investigación de DeepSeek publicó dos artículos técnicos, que presentaban respectivamente un nuevo método de entrenamiento llamado "Conexión residual optimizada (mHC)" y un "Módulo de memoria AI (Engram)" inspirado en la biología. Este movimiento ha provocado que los usuarios especulen que el nuevo modelo desarrollado por DeepSeek puede integrar estos últimos resultados de investigación.