Resumen:
Microsoft está fortaleciendo aún más las capacidades de voz en tiempo real de la plataforma Foundry, proporcionando a los desarrolladores agentes de voz nativos que pueden realizar directamente la entrada y salida de voz, lo que facilita a las empresas la creación de experiencias de IA conversacionales en tiempo real similares a Google Gemini Live.

El cambio principal de la actualización de Microsoft es que el servicio Foundry Agent comienza a admitir capacidades nativas de voz en tiempo real. A diferencia del proceso de los agentes de IA tradicionales que primero convierten la voz en texto, luego la entregan al modelo de texto para su procesamiento y finalmente convierten el texto en voz nuevamente, la arquitectura de voz nativa puede permitir directamente que el modelo de voz en tiempo real procese la entrada de voz del usuario y genere una respuesta de voz, reduciendo así los enlaces intermedios y los retrasos resultantes.
Para los usuarios, esto significa que los agentes de IA pueden entablar conversaciones continuas de forma más natural. Los usuarios no necesitan esperar a que se complete el reconocimiento de voz o que el modelo genere una respuesta de texto completo antes de iniciar la síntesis de voz. El sistema puede acercarse más al método de comunicación en tiempo real entre personas y puede manejar aspectos clave de la interacción de voz, como la interrupción y el juicio de turno.
Las capacidades de Microsoft se basan en la API Voice Live. Esta interfaz integra funciones como reconocimiento de voz, IA generativa, texto a voz, detección de giros y procesamiento de interrupciones en una interfaz de voz unificada en tiempo real, lo que permite a los desarrolladores agregar capacidades de interacción de voz en tiempo real a sus agentes de IA sin tener que crear múltiples componentes de voz por separado.
Para las empresas que han utilizado Foundry Agent Service para crear agentes de IA, esto significa que los agentes originales basados en texto pueden obtener aún más capacidades de interacción de voz, mientras continúan usando la herramienta original de invocación, base de conocimientos, memoria, protección de seguridad de contenido y capacidades de integración de datos y servicios a nivel empresarial.
Microsoft enfatiza particularmente que el agente de voz no es solo un chatbot que puede "leer respuestas", sino que puede llamar a herramientas y realizar tareas durante la comunicación de voz en tiempo real. Por ejemplo, las empresas pueden utilizar esta tecnología para crear sistemas de servicio al cliente que permitan a los usuarios comunicarse directamente con agentes de IA por teléfono; también se puede utilizar para servicios sin barreras, aplicaciones de voz y diversos sistemas corporativos internos que requieren una interacción de voz natural.
En términos de arquitectura técnica, Foundry actualmente admite dos rutas principales de agentes de voz. Uno es el canal de voz tradicional, que convierte el habla del usuario en texto, luego lo entrega al modelo de texto para su inferencia y finalmente convierte el texto generado en voz. El otro es el Speech-to-Speech nativo que se centra en este momento, que es la arquitectura de habla a voz. El modelo de voz en tiempo real procesa directamente la entrada de voz y genera salida de voz.
La mayor ventaja de la arquitectura de voz nativa es que reduce la latencia y al mismo tiempo mantiene mejor el tono, las pausas y el ritmo de comunicación de las conversaciones naturales. Para escenarios que requieren comunicación continua, este método está más cerca de una conversación real en tiempo real que la solución tradicional de múltiples etapas de "reconocimiento de voz → modelo de texto → síntesis de voz".
Microsoft también continúa mejorando las capacidades de interacción en tiempo real de Voice Live API. Las actualizaciones recientes han agregado nuevos tipos de voz nativos en tiempo real y funciones mejoradas como cancelación de eco, detección de cierre inteligente e invocación de herramientas paralelas. La cancelación de eco es particularmente adecuada para agentes de voz que se ejecutan en hardware personalizado o enlaces de audio no estándar. Permite que el sistema haga referencia al sonido realmente reproducido por el cliente, reduciendo así el problema de reconocimiento erróneo después de que la IA escucha su propia voz.
Además de la voz en sí, Microsoft también está fortaleciendo el posicionamiento de Foundry como plataforma de operación y desarrollo de agentes de IA a nivel empresarial. Foundry Agent Service puede ser responsable de la gestión del ciclo de vida de los agentes inteligentes y proporcionar seguridad a nivel empresarial, control de permisos, aislamiento de red, seguimiento de operaciones y capacidades de evaluación. De esta manera, las empresas no necesitan construir una infraestructura desde cero para la operación, monitoreo y comunicación de voz de los agentes de IA.
El movimiento de Microsoft obviamente también apunta a Gemini Live, que Google ha fortalecido continuamente en los últimos años. Gemini Live se ha convertido en un producto importante para que Google demuestre capacidades de inteligencia artificial de voz en tiempo real a los consumidores, mientras que Microsoft enfatiza en brindar capacidades de voz en tiempo real similares directamente a los desarrolladores empresariales, permitiendo a las empresas crear inteligencia de voz exclusiva basada en sus propios datos, herramientas y procesos comerciales.
Por lo tanto, la posición de los dos no es exactamente la misma. Gemini Live proporciona principalmente una experiencia de voz de IA utilizable directamente para usuarios comunes, mientras que Microsoft Foundry está más orientado a empresas y desarrolladores. La atención se centra en permitir que las empresas incorporen capacidades de voz en tiempo real en el servicio al cliente, sistemas telefónicos, negocios internos y otras aplicaciones profesionales.
En los últimos años, Microsoft ha estado promoviendo el desarrollo de agentes de IA, desde simples chatbots hasta sistemas que pueden realizar tareas de forma autónoma. Con la incorporación de capacidades de voz a este sistema, la interacción entre usuarios y agentes se ha expandido gradualmente desde la entrada del teclado hasta conversaciones más naturales en tiempo real. Los agentes no solo pueden responder preguntas, sino que también pueden invocar herramientas, acceder a datos empresariales y completar tareas específicas durante las conversaciones.
Actualmente, Microsoft está integrando gradualmente capacidades como Foundry Agent Service, Voice Live y agentes administrados en la misma plataforma empresarial de IA. A medida que estas tecnologías maduren, la infraestructura que las empresas necesitan desarrollar y mantener para crear servicios de atención al cliente de voz en tiempo real, agentes telefónicos, asistentes de oficina de voz y otros servicios de inteligencia artificial se reducirá aún más.
Esto también significa que la competencia por los asistentes de voz de IA está pasando de simplemente comparar modelos "si pueden chatear" a comparar quién puede proporcionar interacción de voz de menor latencia, capacidades de llamadas de herramientas más completas, infraestructura de nivel empresarial más confiable y un entorno de desarrollo más conveniente. La incorporación de Microsoft de un agente de voz nativo en tiempo real a Foundry es un paso importante para ampliar aún más el diseño de su agente de voz en el mercado de IA empresarial.
Comentarios