Resumen:
Después de fortalecer continuamente las capacidades de razonamiento, código y agente, DeepSeek finalmente agregó información visual a V4. En la mañana del 31 de agosto, DeepSeek estuvo en Hugging Face ha abierto los pesos del modelo DeepSeek-V4-Flash-Vision-Exp y los desarrolladores pueden descargar directamente los pesos del modelo e implementarlos ellos mismos. Además de los archivos de modelo, el almacén oficial también incluye implementaciones de inferencia de referencia de componentes como el codificador visual y Aligner, y cubre DFlash. Atención, MoE, Hyper-Connections y DSpark y otras partes.

Hace apenas 10 días, DeepSeek anunció oficialmente el modelo V4-Flash-Vision-Exp, con una escala de aproximadamente 305 mil millones de parámetros. Es fácil saber por el "Exp" en el nombre que este es el primer modelo multimodal experimental de la serie V4. Está construido sobre la arquitectura V4-Flash. Al agregar un módulo visual y entrenar continuamente, el modelo adquiere la capacidad de procesar imágenes.
En términos de tareas de texto plano, el funcionario dijo que V4-Flash-Vision-Exp y V4-Flash generalmente están en un nivel similar. La principal diferencia es que el nuevo modelo puede reconocer el contenido de las fotografías, leer texto en capturas de pantalla, analizar gráficos y también puede usar imágenes como parte del flujo de trabajo del Agente, en lugar de depender únicamente de descripciones de texto.
Los casos demostrados por DeepSeek incluyen la creación de PPT según los requisitos, la lectura y modificación de páginas web y la generación de páginas frontales con efectos dinámicos.

Lo que estas tareas tienen en común no es el reconocimiento de imágenes en el sentido tradicional, sino que el modelo necesita comprender primero el contenido visual y luego combinar código, razonamiento y llamadas a herramientas para completar operaciones posteriores. A juzgar por la prueba comparativa publicada por DeepSeek, después de agregar capacidades visuales, V4 ya está cerca del modelo grande multimodal Anthropic Claude Opus 4.8 que eligió para comparar en algunas tareas de agentes multimodales.
Específicamente, en la prueba ApexBench, la puntuación Pass@1 de V4-Flash-Vision-Exp fue 36,5, que fue inferior a la de 39,4 de Opus-4.8. La cartografía es 64,3 y 65,0 respectivamente, la brecha es pequeña. En el último examen de los agentes, DeepSeek logró 27,3, superior al 25,7 de Opus-4.8. La puntuación Pass@5 de ZeroBench es 35,0, que también es superior a la de 34,0 de Opus-4.8.

Entre los cuatro datos de prueba multimodal, dos superaron el Opus-4.8
Vale la pena señalar que el módulo visual recién agregado no sacrifica significativamente las capacidades del agente de texto original de V4-Flash.
Por ejemplo, en Terminal Bench 2.1, la versión Vision obtuvo una puntuación de 83,9, mientras que V4-Flash-0731 obtuvo anteriormente una puntuación de 82,7; DeepSWE aumentó de 54,4 a 59,3, superando la puntuación oficial de Opus-4.8 de 58,0. Sin embargo, NL2Repo tiene solo 57,7, que es significativamente más bajo que el 69,7 de Opus-4.8, y CyberGym ha caído del 76,7 anterior al 75,3. Por lo tanto, DeepSeek resume sus capacidades de texto plano como "a la par" con V4-Flash.
Por otro lado, la capacidad visual en sí misma tiene límites. No es un sistema visual que pueda leer infinitamente detalles de alta definición.
Según la documentación de la API de DeepSeek, el modelo admite imágenes JPEG, PNG, GIF y WebP, y puede recibir imágenes únicas o múltiples. Sin embargo, la imagen se escalará según el tamaño antes de ingresar al modelo. Las imágenes más grandes eventualmente se comprimirán a un volumen total de píxeles equivalente a aproximadamente 800 × 800, y cada imagen ocupará hasta 384 tokens.
La razón para elegir este enfoque es controlar el costo computacional causado por la entrada visual. Sin embargo, el escalado de imágenes también puede ser una limitación en tareas que dependen específicamente de texto pequeño, texturas locales o resolución nativa.
Pero pase lo que pase, DeepSeek finalmente compensó los ojos de V4.
Comentarios