Microsoft anunció hoy que ha ampliado aún más su campo de modelos de IA de desarrollo propio, lanzó oficialmente el modelo de edición y generación de imágenes de alta fidelidad MAI-Image-2.5-Pro ​​y lanzó la versión beta pública del modelo de conversión de texto a voz de baja latencia MAI-Voice-2-Flash.

Como modelo de generación de imágenes más preciso de Microsoft hasta la fecha, MAI-Image-2.5-Pro ​​​​está diseñado para escenarios de aplicaciones que requieren generación de imágenes refinada, edición secundaria, diseño de carteles visuales principales y representación de texto más precisa. En términos de estrategia de precios, el modelo se vende a 5 dólares por millón de tokens de entrada de texto, 8 dólares por millón de tokens de entrada de imágenes y 106 dólares por millón de tokens de salida de imágenes. Actualmente, los desarrolladores y usuarios pueden experimentar este modelo de forma gratuita en la plataforma MAI Playground.

Al mismo tiempo, Microsoft lanzó MAI-Voice-2-Flash, que se centra en escenarios de aplicaciones de voz de alta concurrencia y baja latencia, como robots de servicio al cliente. Los datos oficiales muestran que, aunque mantiene una entonación natural y una calidad de sonido de alta calidad, la velocidad de funcionamiento de MAI-Voice-2-Flash se ha duplicado y su coste se ha reducido en un 32%. Tiene un precio de 15 dólares estadounidenses por millón de caracteres.

Microsoft reveló que muchos de sus negocios principales se han integrado completamente en los modelos de la serie MAI de desarrollo propio. Por ejemplo, Bing Image Creator ha cambiado completamente para funcionar con MAI-Image-2.5, y la función de generación de gráficos de PowerPoint también se ha conectado a este modelo. En comparación con la solución de terceros adoptada anteriormente, el costo de la GPU se ha reducido hasta en un 84% después de cambiar al modelo de desarrollo propio. En OneDrive, la aplicación MAI-Image-2.5 aumenta la tasa de guardado de edición de imágenes en un 26 % y reduce la latencia P95 en aproximadamente un 25 %. Además, MAI-Voice-2-Flash se utilizó por primera vez en el centro de contacto de Dynamics 365, ahorrando hasta un 89 % de los costos de GPU, y está disponible como parte de Azure Voice Live para que los desarrolladores creen agentes de interacción de voz. El modelo de transcripción multilingüe MAI-Transcribe-1.5 también ha proporcionado con éxito a Dragon Copilot servicios de dictado en 58 idiomas.