Google lanza la función de interacción humana digital Gemini 3.8 Live Live Avatar, que le da a la IA una cara de video en tiempo real

📅 2026-09-25

Resumen:

Google anunció que lanzó oficialmente la función "Live Avatar" (humano digital en tiempo real) en la plataforma empresarial Gemini Enterprise. Esta tecnología está profundamente integrada con la última arquitectura de modelo grande Gemini 3.8 Live de Google. Basado en el retardo casi nulo original y la conversación de voz muy fluida, introduce por primera vez capacidades de generación de video generativo casi en tiempo real, lo que permite que la inteligencia artificial conversacional tenga una imagen visual dinámica que pueda "escuchar, mirar y hablar al mismo tiempo".

Según la introducción oficial, Gemini 3.8 Live Live Avatar está diseñado para crear un asistente de servicio virtual más intuitivo e inmersivo para clientes empresariales. Al sincronizar con precisión la transmisión de audio con el modelo de generación de video subyacente, el sistema puede lograr sincronización de labios de alta precisión, cambios naturales en las expresiones faciales y una conversión fluida de diálogos en varios idiomas. Actualmente, el sistema humano digital admite de forma nativa hasta 97 idiomas y no habrá distorsión de video ni desviación facial al cambiar de idioma en mitad de una conversación.

Además de los avances visuales, la plataforma también está equipada con potentes capacidades de llamada de herramientas asincrónicas. Mientras mantienen una conversación natural y coherente con los usuarios, los humanos digitales pueden llamar silenciosamente a varias API externas e interfaces de datos empresariales en segundo plano para manejar negocios complejos de varios pasos, como el registro de check-in en el hotel y el llenado de documentos de reclamos de seguros, diciendo adiós por completo al fenómeno de "caída" o larga espera silenciosa que ocurría cuando la IA procesaba tareas en segundo plano en el pasado. Al mismo tiempo, combinado con la cámara y la función de compartir pantalla del dispositivo terminal, el humano digital también puede proporcionar comprensión visual en tiempo real y guía interactiva de los objetos físicos o interfaces de software mostradas por el usuario.

En términos de seguridad y cumplimiento, para prevenir el riesgo de falsificaciones profundas de inteligencia artificial y robo de identidad, Google ha establecido múltiples líneas de defensa de seguridad para Live Avatar. De forma predeterminada, el sistema solo abre a los usuarios corporativos la biblioteca de imágenes humanas digitales que ha sido preestablecida mediante revisión oficial, mientras que el permiso para personalizar imágenes de marcas exclusivas o rostros específicos se coloca bajo un estricto mecanismo de revisión de lista blanca. Además, todas las transmisiones de voz y video dinámicas en tiempo real generadas por el sistema se han incorporado con marcas de agua digitales SynthID invisibles e inalterables para garantizar la transparencia y la trazabilidad del contenido generado por IA.

Actualmente, las funciones Gemini 3.8 Live y Live Avatar se han abierto oficialmente para clientes de suscripción de nivel empresarial a través de nodos de servicios de centros de datos de EE. UU. y Europa, y se proporciona simultáneamente soporte de acceso API para desarrolladores. Los analistas de la industria señalaron que la integración de la tecnología de video generativo directamente en el modelo de voz subyacente no solo elimina la alta latencia causada por las suites de representación de video tradicionales, sino que también marca que el servicio al cliente virtual de IA y los terminales interactivos inteligentes están entrando en una nueva era de "diálogo visual en persona real y en tiempo real".

Etiquetas relacionadas

Artículos relacionados

Comentarios

0/500
Captcha (click to refresh)
Sin comentarios