¿Por qué DeepSeek fue tan cruel con su propio buque insignia cuando lo retiraron de los estantes en 32 días?

📅 2026-09-11

Resumen:

Desde el lanzamiento oficial hasta el momento en que fue reemplazado por Flash, DeepSeek solo dejó 32 días para la versión oficial de V4 Pro.

El 10 de septiembre, DeepSeek lanzó V4.1 Flash y anunció que a partir del mediodía del 14 de septiembre, hora de Beijing, Flash se hará cargo de todas las solicitudes enviadas a V4 Pro en la API oficial y se cobrarán a un precio Flash más bajo. Este acuerdo continuará hasta que se lance V4.1 Pro.

V4 Pro estará disponible como versión preliminar a partir del 24 de abril y se lanzará oficialmente el 13 de agosto.

Menos de un mes después del lanzamiento de la versión oficial, la compañía ya ha decidido su "hora de salida".

Lo que más vale la pena preguntar es: ¿por qué DeepSeek no redujo el precio del Pro y lo mantuvo, o simplemente esperó hasta que la próxima generación de Pro esté lista y luego dejó que los dos asumieran el control normalmente?

Mi opinión es que V4 Pro todavía tiene puntos fuertes, pero ya no vale la inversión continua de DeepSeek solo en potencia informática.

La adopción de V4.1 Flash, que hace que la arquitectura sea más eficiente y ha superado muchas pruebas de agentes inteligentes, no sólo puede reducir los gastos operativos de la empresa, sino también las facturas de los usuarios.

01 Flash ha alcanzado la dirección en la que se centró Pro el mes pasado

Hace un mes, se lanzó la versión oficial de V4 Pro. Su dirección principal es muy clara: agentes inteligentes, programación de código e invocación de herramientas. DeepSeek le abrió diferentes intensidades de inferencia en ese momento y también adaptó especialmente el Codex, con la esperanza de que pudiera asumir trabajos más complejos y de proceso más largo.

Pero algo salió mal el día que la versión oficial estuvo en línea: la notificación del sitio web oficial y el anuncio de plataforma abierta se eliminaron por un tiempo y se restauraron esa noche. Durante este período, siempre se mantuvo la entrada de llamadas a la API. Según informes de los medios, algunos desarrolladores también informaron que el tiempo de pensamiento del modelo era demasiado corto, las tareas largas terminaban prematuramente y los resultados pueden ser muy diferentes si se ejecuta la misma pregunta unas horas más tarde.

El posterior aumento de precio elevó el estándar para su cumplimiento. A partir del 17 de agosto, el precio de salida de Pro durante las horas pico aumentó de 6 yuanes a 27 yuanes por millón de tokens, que es 4,5 veces el precio original.

Para los desarrolladores que ya sienten que su rendimiento es inestable, es difícil decir que este gasto extra se ha cambiado por las mejoras correspondientes.

Ahora, el nuevo Flash acaba de ponerse al día en estas direcciones clave.

Los datos oficiales muestran que en la prueba de ingeniería de software DeepSWE v1.1 y en la prueba de automatización de oficinas AutomationBench, Flash obtuvo 74,2 puntos y 54,8 puntos respectivamente, significativamente por delante de los 62,7 puntos y 43,2 puntos de V4Pro.

Lo que gana el nuevo modelo es precisamente la tarea que promovió Pro el mes pasado.

Pro no pierde en todo momento. En el subconjunto de texto plano HLE que no llama a herramientas, todavía lidera a Flash con 42,7 puntos y 39,1 puntos; pero en la prueba HLE completa que permite el uso de herramientas, Flash obtuvo 63,9 puntos, 60 puntos más que Pro. Además, en la comparación de modelos básicos antes del entrenamiento posterior, Pro aún mantiene el liderazgo en preguntas y respuestas de conocimiento verificadas por SimpleQA y pruebas de texto largo LongBench-V2.

Por lo tanto, la "superación integral" en el anuncio oficial de DeepSeek no puede entenderse simplemente como una victoria en todas las subcategorías.

Todavía hay cosas que el Pro hace bien y sigue siendo valioso para los usuarios que necesitan esas habilidades específicas. Lo que realmente está sacudido es el posicionamiento comercial original del producto estrella.

En el pasado, los desarrolladores y las empresas entendían fácilmente la división de los dos modelos: se elegía Flash si el presupuesto era limitado y las tareas complejas y largas se dejaban al Pro, más caro. Ahora que Flash ha superado muchas pruebas de teléfonos inteligentes convencionales, es difícil para Pro convencer al mercado con la etiqueta de "más caro, pero en general más fuerte".

Una ventaja amplia es suficiente para respaldar un buque insignia de alto precio para el público en general; pero si sólo domina algunas tareas segmentadas, la empresa debe recalcular: cuántas personas no pueden prescindir de estas capacidades, qué prima están dispuestas a pagar por ellas y si vale la pena asignar clústeres de potencia informática para respaldarlas.

La información pública aún no proporciona cuentas específicas de costos y desgloses de usuarios. Pero a juzgar por las acciones del producto de DeepSeek, obviamente ha renunciado a la idea de conservar un equipo independiente y exclusivo para el antiguo Pro.

02 Reduce el precio de Pro y ahorra el coste de ejecutarlo

Si el problema es simplemente que Flash es barato, Pro naturalmente puede seguir la promoción de reducción de precio. La dificultad es que los recortes de precios sólo pueden cambiar las cifras de la factura, pero no el consumo físico subyacente al modelo.

Según los datos revelados por la tarjeta modelo oficial, la cantidad de parámetros activados por cada Token de V4 Pro llega a 49 mil millones. V4.1Flash desacopla el procesamiento de entradas de la generación de respuestas, activando sólo 8 mil millones y 16 mil millones de parámetros respectivamente. Aunque la relación de parámetros no puede equipararse directamente a la reducción de costos, la escala de cálculo requerida para cada inferencia directa entre los dos es completamente diferente en el mismo orden de magnitud.

La nueva arquitectura también reduce significativamente la sobrecarga de almacenamiento de tareas de contexto largas. En comparación con V4 Flash, el caché KV global ocupado por V4.1 Flash se ha reducido a aproximadamente una cuarta parte, y el espacio SSD ocupado por el caché KV persistente se ha reducido a aproximadamente un octavo. La ejecución del agente necesita leer repetidamente el código de contexto, los documentos de referencia y los datos devueltos por herramientas externas. El caché se utiliza especialmente para almacenar el estado histórico calculado por el modelo grande.

Una vez que el ciclo de la tarea se alarga y la cantidad de concurrencia aumenta, la memoria de almacenamiento tocará fondo rápidamente. Lo que Flash tiene que resolver no es sólo responder una pregunta correctamente, sino también la escasez de recursos cuando se ejecutan tareas masivas y simultáneas al mismo tiempo.

DeepSeek mencionó directamente en el anuncio que una mayor eficiencia arquitectónica permite a la empresa ofrecer más concurrencia a un costo menor, por lo que es lógico bajar el precio.

A partir del 11 de septiembre, calculado por millón de tokens en Gushi, el precio de entrada del caché de pérdida V4 Pro es de 4,5 yuanes y el precio de salida es de 13,5 yuanes; los precios correspondientes de V4.1 Flash son solo 1 yuan y 4 yuanes (los precios máximos de ambos modelos son el doble que los de Gushi). Con la implementación del cambio, los costos de la interfaz Pro originalmente costosa se reducirán directamente al nivel de Flash.

Aunque la diferencia de precio entre los dos no es equivalente al costo real del material de DeepSeek, la estrategia es muy clara: utilizar una nueva arquitectura altamente eficiente para aceptar completamente las solicitudes de interfaces antiguas y luego transferir los costos de hardware ahorrados al mercado.

Si reduce el precio de Pro, la plataforma seguirá teniendo que soportar sola los altos costos de inferencia y mantenimiento; cambiar a Flash tendrá la oportunidad de reducir las facturas de los usuarios y la carga del servidor al mismo tiempo.

Después de que el gran modelo terminó de entrenar, el pozo sin fondo del dinero no se cerró. Cada vez que responde a una llamada, ocupa recursos informáticos en tiempo real y la operación y mantenimiento no pueden detenerse ni un momento.

"Acabo de gastar mucho dinero para entrenar" no puede ser una medalla de oro sin muerte para conservar al viejo Pro. Los costos hundidos se han convertido en una realidad y mantener el antiguo modelo requiere un consumo continuo de dinero real.

Incluso si el antiguo Pro puede seguir generando dinero, obviamente es más rentable utilizar la misma potencia informática del hardware para ejecutar un nuevo modelo con mayor eficiencia.

03 La entrega de 160.000 chips Ascend puede tardar más de un año

En combinación con las recientes acciones clave de DeepSeek, podemos comprender mejor el sentido de urgencia detrás de esta transferencia de recursos.

En agosto de este año, DeepSeek lanzó precios flotantes de pico y valle para guiar las tareas de procesamiento por lotes no en tiempo real para que se ejecuten durante los tiempos de inactividad.

Esto es esencialmente para exprimir toda la potencia informática existente de la programación interna cuando el hardware externo es limitado.

La adquisición de hardware también avanza, pero el agua de lejos no puede saciar la sed de cercanía. Bloomberg informó el 4 de septiembre, citando a personas familiarizadas con el asunto, que DeepSeek planea implementar al menos 160.000 chips Huawei Ascend 950DT en centros de datos en Mongolia Interior, que actualmente están planificados principalmente para inferencia de modelos en lugar de entrenamiento. Sin embargo, el informe también menciona que la capacidad de producción de Huawei debe atender a múltiples clientes y, debido a los cuellos de botella en la cadena de suministro, el ciclo completo de entrega de pedidos puede tardar más de un año.

La financiación de DeepSeek también se está acelerando. Reuters informó el 9 de septiembre, citando a personas familiarizadas con el asunto, que DeepSeek había contratado a CITIC Securities para promover el proceso de salida a bolsa de la Junta de Innovación de Ciencia y Tecnología. La recaudación de fondos tiene como objetivo principal cubrir el déficit de financiación para infraestructura informática, investigación y desarrollo de modelos de vanguardia y contratación de los mejores talentos. Sin embargo, el calendario de cotización, el monto de recaudación de fondos y el objetivo de valoración aún no se han finalizado, y ni DeepSeek ni CITIC Securities hicieron comentarios al respecto.

Al juntar estas piezas del rompecabezas, lo que surge es una empresa emergente que desea una rápida expansión pero que siempre está limitada por los límites de los recursos físicos.

Comprar hardware externo y buscar financiación para la IPO resuelve el problema del incremento de recursos a largo plazo; mientras que el esfuerzo por lograr la eficiencia en la arquitectura del algoritmo es permitir que la potencia informática existente resista un mayor pico de llamadas.

El primero requiere un ciclo de entrega largo y una operación de capital, mientras que el segundo puede liberar inmediatamente capacidad en los negocios existentes siempre que la tecnología madure.

Con limitaciones de recursos tan estrictas, es factible seguir manteniendo el antiguo buque insignia, pero la relación precio/rendimiento es extremadamente baja.

Cuando los modelos más livianos y baratos ya son capaces de realizar la mayoría de las tareas principales, las pocas ventajas individuales que deja el antiguo Pro son realmente difíciles de convencer al equipo de continuar asignando valiosos clústeres para respaldarlo.

El fundador, Liang Wenfeng, había dejado clara esta compensación cuando se comunicó con los inversores anteriormente. Claramente antepone la exploración de AGI a largo plazo a la maximización de ganancias a corto plazo, cree que el modelo de código abierto y la comercialización son completamente autoconsistentes y afirma sin rodeos que la potencia informática es el principal cuello de botella de la expansión empresarial actual.

Mirando retrospectivamente este "cambio repentino de modelo" desde esta perspectiva, prefiero una explicación estratégica: el objetivo de DeepSeek es llevar la escala de los servicios existentes al extremo lo antes posible y al mismo tiempo promover la próxima generación de exploración de fronteras.

Ahora que las nuevas tecnologías han reestructurado completamente el costo de la potencia informática y las curvas de rendimiento, es necesario reorganizar enérgicamente la matriz de productos. No es necesario imponer un largo período de protección de prima para los buques insignia de la generación anterior.

04 DeepSeek no está esperando al próximo Pro

La característica más llamativa de este reemplazo es su decisión: DeepSeek ni siquiera esperó a que V4.1 Pro tomara forma.

De acuerdo con la práctica del software comercial convencional, puede conservar completamente el canal independiente del antiguo Pro para apaciguar a los clientes empresariales que dependen del modelo anterior y, al mismo tiempo, lanzar Flash como un reemplazo degradado; Espere hasta que la próxima generación Pro esté completamente madura y luego complete la iteración paso a paso para que la línea de productos se vea fluida y ordenada.

Pero DeepSeek anunció otro acuerdo: el antiguo Flash será reemplazado por V4.1 Flash, y el tráfico API del antiguo Pro también se fusionará por la fuerza con Flash después del 14 de septiembre. Aunque se conserva el nombre de la interfaz original y la facturación se descuenta directamente, el núcleo del modelo subyacente ha sido reemplazado por completo.

El funcionario aún mencionó el futuro V4.1 Pro, pero no lo esperaron y continúan manteniendo la posición del antiguo Pro.

DeepSeek está dispuesto a permitir que su nueva tecnología elimine primero su antiguo buque insignia. La cantidad de inversión en investigación y desarrollo y el hecho de que solo lleve un mes en línea no se han convertido en motivo para protegerlo.

Sin embargo, sólo porque el nombre de la interfaz permanezca sin cambios no significa que los desarrolladores puedan sentarse y relajarse.

Muchas empresas han ajustado previamente el marco Prompt, la configuración del sistema y los enlaces de llamada de herramientas de varios pasos en el antiguo Pro, y lo más probable es que necesiten volver a ejecutar pruebas de regresión en el nuevo modelo.

Si el desempeño de ciertas tareas que dependen en gran medida del razonamiento de texto largo o texto plano de Pro disminuye, los llamados de la comunidad y los clientes corporativos para conservar el antiguo canal también tienen una racionalidad práctica.

Esto plantea un problema para el Pro de próxima generación que aún no se ha presentado: si quiere volver a ofrecer servicios independientes a un precio más alto, debe ofrecer capacidades que son difíciles de lograr con Flash y que valen el pago adicional para los usuarios, no sólo mejores que el antiguo Pro.

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
Captcha (click to refresh)
Sin comentarios