Resumen:
OpenAI anunció recientemente que GPT-Live-1, que actualmente se utiliza para la función de voz ChatGPT, se abrirá oficialmente a los desarrolladores. Los desarrolladores ahora pueden integrar este modelo de voz en sus propias aplicaciones y procesos comerciales a través de API para crear asistentes de voz full-duplex que puedan escuchar a los usuarios en tiempo real y responder al mismo tiempo. El precio de entrada de voz de este modelo es de 0,05 dólares estadounidenses por minuto, y el modelo utilizado en segundo plano para razonamientos complejos debe facturarse por separado de acuerdo con el precio del modelo correspondiente.

GPT-Live-1 es una nueva generación de modelo de voz en tiempo real lanzado por OpenAI este año. Su característica más importante es su arquitectura full-duplex. La IA de voz tradicional generalmente necesita completar los tres pasos de reconocimiento de voz, inferencia de modelo de lenguaje y síntesis de voz en secuencia. Solo después de que el usuario termina de hablar, el sistema puede comenzar a procesar y generar respuestas. GPT-Live-1, por otro lado, puede generar salida de voz mientras escucha hablar al usuario, por lo que puede manejar interrupciones, pausas, ecos y conversaciones rápidas de ida y vuelta de forma más natural.
Esto significa que los usuarios no tienen que esperar a que la IA termine de hablar por completo antes de continuar hablando. Si el usuario cambia de opinión, agrega información o interrumpe directamente, GPT-Live-1 puede ajustar su comportamiento a tiempo de acuerdo con la conversación en curso. El modelo también puede indicar cuándo seguir hablando, cuándo hacer una pausa, cuándo seguir escuchando y cuándo recurrir a las herramientas.
OpenAI declaró que esta arquitectura puede reducir significativamente el retraso en la interacción de voz y resolver los problemas de conexión que tienden a ocurrir en conversaciones reales en el proceso tradicional de "reconocimiento de voz + modelo de lenguaje grande + síntesis de voz". Dado que GPT-Live-1 maneja tanto la entrada como la salida de audio, los desarrolladores ya no necesitan coordinar cambios complejos entre múltiples modelos independientes.
En la prueba publicada por OpenAI, el rendimiento de GPT-Live-1 en la prueba Full Duplex Bench fue 30 puntos porcentuales superior al de GPT-Realtime-2.1, especialmente en términos de retraso en la toma de turnos y comportamiento interactivo. Cuando se combinó con GPT-6 Astra a una intensidad de inferencia media, GPT-Live-1 también logró el primer lugar en la prueba Tau3. Tau3 se utiliza principalmente para evaluar la capacidad de los agentes de voz para completar tareas de un extremo a otro.
Otra característica importante de GPT-Live-1 es que no es responsable de todo el trabajo de razonamiento complejo. OpenAI separa el modelo de voz responsable de escuchar, hablar e interactuar en tiempo real del modelo de fondo responsable del razonamiento profundo. Cuando los usuarios hacen preguntas que requieren búsqueda, análisis complejos o tareas largas, GPT-Live-1 puede transferir estas tareas al modelo en segundo plano mientras continúa manteniendo una comunicación de voz natural con el usuario.
Por lo tanto, los desarrolladores son libres de elegir modelos de backend en función de las necesidades empresariales específicas. Por ejemplo, para una gran cantidad de tareas sencillas, como reservas y actualizaciones de pedidos, se pueden utilizar modelos más rápidos y de menor coste; para problemas complejos de clientes, pueden manejarse mediante modelos de inferencia más sólidos. Esta arquitectura permite a los desarrolladores encontrar un equilibrio entre la capacidad de respuesta, las capacidades de razonamiento y el costo de uso.
OpenAI declaró que este diseño desacoplado también permite que GPT-Live-1 continúe comunicándose con los usuarios mientras realiza tareas en segundo plano, en lugar de permitir que los usuarios enfrenten un largo período de espera silenciosa. El modelo puede continuar una conversación natural mientras completa trabajos más complejos en segundo plano y luego devolver los resultados a la conversación actual cuando se completa la tarea.
Ya están empezando a surgir aplicaciones prácticas. Los primeros ejemplos demostrados por OpenAI incluyen servicios de voz como Yelp Host y Hatch, y la plataforma de aprendizaje de idiomas Speak. Speak descubrió en evaluaciones iniciales que, en comparación con los sistemas de voz por turnos anteriores, GPT-Live-1 puede dar a los estudiantes de idiomas más tiempo para pensar, reduciendo la cantidad de interrupciones proactivas del sistema para los usuarios en casi un 80%.
Para las empresas, esta capacidad es especialmente adecuada para atención al cliente, atención telefónica al cliente, reservas y otros escenarios que requieren interacción de voz continua. GPT-Live-1 admite de forma nativa escenarios telefónicos, por lo que los desarrolladores pueden usarlo para crear agentes de voz full-duplex que puedan responder y manejar llamadas telefónicas, como reservas en restaurantes, atención al cliente y otras empresas que requieren comunicación en tiempo real.
GPT-Live-1 también proporciona texto transcrito con reconocimiento automático de voz nativo y texto de respuesta modelo, y mejora la comprensión de combinaciones alfanuméricas, al tiempo que admite funciones de sesgo de palabras clave. Aunque no es un modelo por turnos en el sentido tradicional, aún admite la detección de turnos de forma nativa. Por lo tanto, si los desarrolladores necesitan controlar claramente cuándo el usuario termina de hablar y cuándo el sistema comienza a responder, aún pueden diseñar sus aplicaciones en torno a turnos de diálogo claros.
GPT-Live-1 también se ha optimizado para escenas con entornos de fondo ruidosos. El modelo puede distinguir mejor entre el habla del usuario, el ruido de fondo y el silencio. No interrumpirá con frecuencia las conversaciones debido a los sonidos del entorno, ni recordará constantemente a los usuarios cuando estén pensando brevemente. Esta capacidad es especialmente importante para llamadas telefónicas, servicio al cliente y asistentes de voz móviles en entornos del mundo real.
OpenAI también ha ampliado la selección de sonido disponible para GPT-Live-1. En comparación con el número relativamente limitado de voces en tiempo real disponibles anteriormente, la nueva versión ofrece voces más diversas y cubre una gama más rica de acentos, dialectos e idiomas. OpenAI dice que seguirá añadiendo voces e idiomas disponibles en los próximos meses.
En términos de implementación del modelo, los desarrolladores no necesitan entregar todas las tareas a GPT-Live-1. OpenAI espera utilizarlo como interfaz responsable de la interacción de voz en tiempo real, asumiendo trabajos más complejos a través de modelos en segundo plano y marcos de agentes. Este enfoque también permite a los desarrolladores combinar diferentes modelos según las necesidades reales de diferentes tareas.
Por ejemplo, los desarrolladores pueden dejar que GPT-Live-1 sea responsable de recibir las solicitudes de voz de los usuarios, mantener conversaciones naturales y manejar las interrupciones, y luego entregar preguntas que requieran un razonamiento complejo al modelo en segundo plano; Una vez que el modelo en segundo plano completa el trabajo, GPT-Live-1 convierte los resultados en respuestas de voz naturales. Este mecanismo también se aplica a aplicaciones que necesitan llamar a herramientas externas.
OpenAI también demostró cómo combinar GPT-Live-1 con herramientas como Codex. Los desarrolladores pueden permitir que el modelo de voz reciba las tareas propuestas por el usuario, luego transferir el contexto relevante a herramientas en segundo plano como Codex para su procesamiento y luego devolver los resultados del procesamiento a GPT-Live-1, que continuará comunicándose con el usuario a través de voz.
En términos de precio, GPT-Live-1 ahora está disponible oficialmente a través de la API OpenAI y el front-end de voz cuesta $0,05 por minuto. Es importante tener en cuenta que este es sólo el costo del nivel de voz en tiempo real. Si el desarrollador equipa GPT-Live-1 con un modelo de inferencia en segundo plano, el costo de llamar al modelo en segundo plano debe calcularse por separado en función del precio del modelo correspondiente.
Esto significa que para aplicaciones empresariales que requieren una gran cantidad de llamadas de voz, el costo real no es solo de $0,05 por minuto, sino que se compone del tiempo de conexión de voz y el consumo de inferencia del modelo en segundo plano. Sin embargo, los desarrolladores pueden controlar el costo total según la complejidad de la tarea eligiendo diferentes modelos de back-end.
La apertura de GPT-Live-1 también significa que OpenAI está ampliando aún más la tecnología central detrás del modo de voz ChatGPT desde productos de consumo hasta el ecosistema de desarrolladores. Anteriormente, GPT-Live-1 existía principalmente como la capacidad de interacción de voz de ChatGPT. Ahora los desarrolladores pueden utilizar directamente tecnologías similares para crear sus propias aplicaciones y agentes de voz.
Desde una perspectiva técnica, OpenAI espera que GPT-Live-1 no solo resuelva "permitir que la IA hable", sino que también permita que la IA participe verdaderamente en conversaciones naturales continuas, en tiempo real e interrumpibles. Al dividir la escucha, el habla, la interacción en tiempo real y el razonamiento profundo, OpenAI intenta lograr una latencia de voz más baja, una experiencia de conversación más natural y capacidades de procesamiento de tareas en segundo plano más sólidas al mismo tiempo.
A medida que los agentes de voz pasan gradualmente de simples preguntas y respuestas de voz a tareas complejas como atención telefónica al cliente, reservas, educación de idiomas, procesamiento comercial y la capacidad de llamar de forma autónoma a herramientas para completar tareas, la importancia de los modelos de voz en tiempo real también está aumentando. La API abierta de GPT-Live-1 significa que los desarrolladores ahora pueden integrar directamente la generación actual de tecnología de voz en tiempo real utilizada por ChatGPT en sus propios productos, y el precio de la capa de voz de 0,05 dólares estadounidenses por minuto también permite que esta capacidad entre oficialmente en la etapa de aplicación comercial.
Comentarios