El 17 de febrero, el Wall Street Journal publicó un artículo:Explica cómo DeepSeek utiliza menores costes de desarrollo y chips menos potentes para rivalizar con otros modelos grandes más avanzados del mundo., incluso más ventajoso en algunos aspectos. Eso es "adelantar en una curva". Las siguientes son las tres principales “tecnologías negras” de DeepSeek:

1. Aprendizaje por refuerzo

Según un artículo publicado por DeepSeek, el modelo grande es capaz de "ganar más con menos" porque su último modelo R1 se basa más en una técnica llamada aprendizaje por refuerzo. En este proceso,El modelo obtiene retroalimentación de su propio comportamiento mediante un sistema de recompensas que crea y ajusta continuamente.

El modelo se basa en grandes volúmenes de texto existentes, que se dividen en palabras únicas, fragmentos de palabras y signos de puntuación y luego se vuelven a ensamblar de diferentes maneras. Este gran modelo de lenguaje tiene más de 671 mil millones de configuraciones ajustables, llamadas "parámetros", que determinan cómo responde el modelo a las instrucciones.


El número de parámetros de un modelo es una medida de su tamaño.A diferencia de los modelos de IA tradicionales, solo un pequeño conjunto de configuraciones ajustables están activas durante cualquier operación del R1.La reducción de los parámetros activos reduce drásticamente la potencia y la computación necesarias para el procesamiento, lo que permite que el modelo funcione con chips más baratos y menos avanzados.

2. Mezcla de expertos

El modelo R1 de DeepSeek funciona dividiéndose en múltiples redes con diferente experiencia, un enfoque llamado "mezcla experta".Ciertas instrucciones requieren experiencia diferente y, para responder a las instrucciones, el modelo solo procesará las redes que considere más relevantes.

Por el contrario, los modelos tradicionales de IA se basan en conjuntos masivos de datos preetiquetados en un proceso llamado aprendizaje supervisado. El premarcado se realiza manualmente, lo que resulta caro y requiere mucho tiempo.EspecializarseLa tecnología híbrida doméstica ha reducido considerablemente el coste de la formación en IA.

3. Código abierto

Los modelos de DeepSeek también son únicos porque son de código abierto, lo que significa que los desarrolladores externos a la empresa también pueden reutilizarlos.

El modelo R1 de la compañía encabezó la lista en la plataforma ChatbotArena, dirigida por investigadores de la Universidad de California, Berkeley, que califica modelos de inteligencia artificial.

R1 supera a la mayoría de los demás modelos en tareas como matemáticas y codificación.



Los datos de ChatbotArena provienen de visitantes que utilizan su sitio web para hacer preguntas, obtener respuestas de dos modelos de IA anónimos y luego calificar cuál respuesta es mejor. El sitio ha recogido más de 2,5 millones de votos sobre unos 200 modelos.

DeepSeek ofrece a los desarrolladores precios más bajos que muchos otros modelos en su categoría de inteligencia, según datos compilados por la firma de evaluación comparativa de inteligencia artificial Artificial Analysis. .

Los desarrolladores de modelos de IA cobran a los usuarios, como las empresas que quieren integrar la tecnología en sus productos, en función de la cantidad de datos (o “tokens” en el lenguaje de la industria) que se transfieren de un lado a otro entre las dos partes.


El Wall Street Journal dijo que el modelo chino de DeepSeek es competitivo con los modelos de los principales desarrolladores de inteligencia artificial de Estados Unidos en términos de rendimiento y precio.