Resumen:
Microsoft ha lanzado tres nuevos modelos para interacción de voz en tiempo real, a saber, el modelo de voz a texto MAI-Transcribe-2-Streaming y los modelos de texto a voz MAI-Voice-2.1 y MAI-Voice-2.1-Flash. Microsoft espera que los desarrolladores los combinen para crear asistentes de voz y agentes conversacionales que puedan procesar mientras escuchan y responder instantáneamente con voz natural.

MAI-Transcribe-2-Streaming es diferente del MAI-Transcribe-2 anterior que solo puede procesar archivos de grabación. Puede recibir flujos de audio de entrada continuos y comenzar a generar texto preparado antes de que el orador haya terminado de hablar. Se seguirá revisando a medida que llegue más contexto y finalmente presenta resultados estables. Microsoft dijo que el modelo admite 60 idiomas y puede reconocer idiomas de forma continua y automática; Se supone que el primer lote de reconocimiento aparece un poco más de 100 milisegundos después de recibir el audio y es adecuado para escenarios como agentes de voz, servicio al cliente, subtítulos de conferencias y aulas, y entrada de voz. Las pruebas internas de dictado y subtítulos de Microsoft muestran que el texto aparece aproximadamente dos veces más rápido que el competidor más cercano, una comparación basada en las propias revisiones de la compañía.
El punto de referencia de transcripción en streaming de Artificial Analysis clasifica al modelo en primer lugar en cuanto a precisión del texto final y preparado. Los resultados de las pruebas publicadas fueron que la tasa de error de la palabra transcrita final fue de aproximadamente el 2,5% y el texto final se entregó aproximadamente 0,13 segundos después de que se detectó el final del discurso. La lista comparó 38 modelos en ese momento, probó alrededor de 8 horas de audio y cubrió tres tipos de corpus: AA-AgentTalk, VoxPopuli y Earnings22, que representan el 50%, 25% y 25% del peso total respectivamente. Cuanto menor sea la tasa de error de palabras, mejor. Este resultado ilustra el rendimiento del modelo en este conjunto de puntos de referencia y no significa que se pueda lograr la misma precisión en todos los lenguajes, entornos ruidosos y aplicaciones del mundo real.
MAI-Transcribe-2-Streaming está actualmente a la venta por 0,54 dólares la hora de audio y la oferta dura hasta finales de 2026; en comparación, MAI-Transcribe-2 sin transmisión se anunciaba anteriormente a 0,10 dólares la hora. La versión en tiempo real es más adecuada para la interacción continua, mientras que la versión por lotes es para grabar transcripciones de audio. Los precios de ambos no pueden considerarse simplemente como una comparación directa bajo el mismo método de uso.
El nuevo modelo de síntesis de voz MAI-Voice-2.1 admite 23 idiomas y 26 variantes regionales, lo que permite que la misma voz sintetizada cambie entre diferentes idiomas conservando la identidad del hablante y adoptando el acento local del idioma correspondiente. Tiene un precio de 22 dólares estadounidenses por millón de caracteres. MAI-Voice-2.1-Flash para solicitudes de baja latencia y a gran escala admite el mismo idioma. Microsoft dice que puede generar 45 segundos de audio con un retraso de un extremo a otro de unos 150 milisegundos. La velocidad de inferencia del modelo aumenta en un 55% y el precio es aproximadamente un 60% más bajo que el de modelos comparables. Tiene un precio de 15 dólares por 1 millón de caracteres. Este último conjunto de ventajas de velocidad y precio se encuentran entre las comparaciones publicadas por Microsoft.
Ambos modelos de voz admiten la clonación de voz en tiempo real entre idiomas, pero solo con el uso de voces de referencia autorizadas y consentidas. La documentación de Microsoft enumera la función como de acceso restringido, con una recomendación de audio de referencia de 5 a 60 segundos y protecciones contra el abuso. MAI-Voice-2.1 es adecuado para contenidos más extensos, narraciones y audiolibros, mientras que Flash es más adecuado para escenarios en tiempo real como agentes de voz, asistentes y servicio al cliente.
Los tres modelos se pueden utilizar a través de Microsoft Foundry, MAI Playground y Vercel; Los dos modelos de Voice también se han conectado a OpenRouter y se pueden llamar a través de Azure Voice Live. Se espera que la compatibilidad con LiveKit se lance más adelante. Actualmente, la documentación de Microsoft Azure etiqueta estos modelos como versión preliminar pública, indicando que no existe un acuerdo de nivel de servicio y que no se recomienda su uso directo en cargas de trabajo de producción.
Más información:
https://microsoft.ai/news/our-first-streaming-transcription-model/
Comentarios