Resumen:
El equipo Qwen de Alibaba lanzó recientemente una nueva generación de modelo nativo totalmente modal Qwen3.8-Omni-Flash, que combina aún más la comprensión de audio y video con capacidades de agente de IA.
El modelo admite cuatro formas de entrada: texto, imagen, audio y vídeo, y proporciona una ventana de contexto de 1 millón de tokens. En comparación con la generación anterior Qwen3.5-Omni-Plus, los funcionarios de Qwen afirman que su puntuación promedio en 29 pruebas de referencia ha aumentado en más del 25%, al tiempo que reduce significativamente los costos de procesamiento de audio y video.

Uno de los mayores cambios en Qwen3.8-Omni-Flash es que no simplemente une el reconocimiento de voz, el reconocimiento de imágenes y otras capacidades, sino que procesa de forma nativa diferentes tipos de información desde el nivel del modelo. Alibaba espera utilizar esto para permitir que el modelo no solo "comprenda" o "entienda" el contenido de audio y video, sino que también planifique tareas, llame a herramientas y complete el trabajo real después de comprender esta información.
En términos de capacidades de audio, el rendimiento de Qwen3.8-Omni-Flash es particularmente sobresaliente. Según datos publicados por Qwen, este modelo ha superado al Gemini 3.8 Flash en algunas pruebas de referencia de audio. Por ejemplo, en la prueba de llamada de herramienta multimodal WildClawBench-MM, Qwen3.8-Omni-Flash obtuvo 71,0 puntos, mientras que Gemini 3.8 Flash obtuvo 58,9 puntos; en la prueba DailyOmni, Qwen obtuvo 85,1 puntos y Gemini obtuvo 84,0 puntos; en SpotSoundBench, los dos obtuvieron 67,2 puntos y 39,7 puntos respectivamente; en la prueba MMAU obtuvieron 81,8 puntos y 76,9 puntos.
El reconocimiento de voz en conferencias con varios oradores también es el foco de esta actualización. Los datos de prueba de AliMeeting publicados por Qwen muestran que la tasa de error del hablante DER de Qwen3.8-Omni-Flash es 3,35, y la tasa de error de palabras cpWER con atribución del hablante es 17,18, mientras que la generación anterior Qwen3.5-Omni-Plus es 88,11 y 89,61 respectivamente. Esto significa que el nuevo modelo cambia significativamente en esta prueba.
Sin embargo, Qwen3.8-Omni-Flash no está por delante de Gemini 3.8 Flash en todos los proyectos. Por ejemplo, en la prueba AgenticVBench, Gemini 3.8 Flash obtuvo 45,0 puntos y Qwen obtuvo 36,8 puntos; en OmniGAIA obtuvieron 78,6 y 74,0 puntos respectivamente. En algunas pruebas de comprensión de vídeos, Gemini también mantuvo su ventaja. Por lo tanto, el énfasis de Qwen en "acercarse a Géminis" se refleja más en las capacidades generales de audio y audio y video, y no significa un liderazgo general en todos los proyectos multimodales.
Otro cambio importante en Qwen3.8-Omni-Flash es el precio. Qwen dice que su costo estimado por hora para entrada de audio se ha reducido en más de un 98 % y el costo por hora para entrada de audio más video se ha reducido en más de un 93 % en comparación con el modelo anterior. Según el método de cálculo oficial, el coste llamado "por hora" se calcula multiplicando el precio de procesamiento de dos minutos de material por 30, en los que el vídeo adopta la condición de entrada de 720p y 1 fotograma por segundo.
El precio regional internacional actual anunciado por Alibaba Cloud es de 0,15 dólares estadounidenses por millón de tokens de entrada, el token de entrada que llega al caché es de 0,016 dólares estadounidenses y el token de salida por millón es de 0,47 dólares estadounidenses. Los precios en China continental y algunas otras regiones variarán. Dado que el audio y el video se pueden usar directamente como entradas del modelo, esta estructura de precios es particularmente adecuada para escenarios como grabación de reuniones, análisis de audio extenso, revisión de video, generación de subtítulos y procesamiento de grandes cantidades de contenido multimedia.
La ventana de contexto de 1 millón de tokens amplifica aún más esta ventaja. La longitud máxima de entrada de Qwen3.8-Omni-Flash es cercana a los 992.000 tokens, la longitud máxima de entrada en el modo de pensamiento es de aproximadamente 984.000 tokens y la longitud máxima de salida alcanza los 131.000 tokens. Esto significa que los desarrolladores pueden entregar directamente contenido de audio o video a muy gran escala al modelo para su procesamiento, sin tener que cortar y extraer fotogramas con frecuencia como en el pasado, y luego usar múltiples modelos para completar el reconocimiento de voz, la comprensión visual y el razonamiento de texto, respectivamente.
La información oficial de Alibaba Cloud muestra que Qwen3.8-Omni-Flash puede manejar entradas de audio en 113 idiomas y dialectos y admite análisis de audio espacial. A través de parámetros relevantes, el modelo puede manejar audio estéreo de dos canales y audio espacial de cuatro canales. Al mismo tiempo, el modelo admite llamadas de funciones, búsqueda de red, almacenamiento en caché de contexto y otras capacidades, y puede usarse directamente en flujos de trabajo de agentes más complejos.
Desde la perspectiva de la dirección de la aplicación, esta vez el equipo de Qwen se centra en la "entrega inteligente". Por ejemplo, el modelo puede analizar videos largos, localizar contenido clave y utilizar más herramientas para completar tareas como edición de video, organización de contenido, resumen de reuniones y generación de subtítulos. Qwen también anunció Qwen-MM-Plugins para el desarrollo de agentes multimodales y planea lanzar Qwen-Live-Harness para ayudar a los desarrolladores a desarrollar aún más aplicaciones de agentes inteligentes basadas en entradas de audio y video.
En comparación con la generación anterior Qwen3.5-Omni, el objetivo de esta actualización no es solo mejorar la precisión del reconocimiento en el sentido tradicional, sino intentar cambiar la forma en que se utiliza la IA de audio y vídeo. En el pasado, las aplicaciones multimodales generalmente requerían extraer cuadros de video y transcribir audio, y luego entregar los diferentes resultados al modelo de lenguaje para su procesamiento; Qwen3.8-Omni-Flash intenta unificar estos enlaces en un modelo nativo completo tanto como sea posible y utiliza 1 millón de contextos Token para procesar directamente contenido original más extenso.
Qwen3.8-Omni-Flash actualmente brinda servicios a través de Alibaba Cloud Bailian y brinda soporte a regiones como Beijing, Singapur, Hong Kong, China, Tokio, Japón, Frankfurt, Alemania y Virginia, Estados Unidos. El modelo en sí no abre directamente las pesas como algunos modelos anteriores de Qwen. Esta vez, Alibaba abre principalmente complementos multimodales de soporte y herramientas de desarrollo relacionadas.
En general, el núcleo de esta actualización de Qwen3.8-Omni-Flash no es solo mejorar las puntuaciones de ejecución del modelo, sino también reducir simultáneamente los costos de procesamiento de video bajo, expandir la escala de contexto y combinar la comprensión de audio y video con la invocación de herramientas. En particular, el coste de la entrada de audio se ha reducido en más del 98%. Si el costo de uso real puede alcanzar el nivel de cálculo oficial, facilitará el análisis automático a gran escala de grabaciones de reuniones a largo plazo, podcasts, transmisiones en vivo y materiales de video, e intensificará aún más la competencia entre Qwen y modelos multimodales como Google Gemini.
Comentarios