Cómo llegamos aquí
Hasta ahora, la voz de ChatGPT funcionaba con un sistema en cascada: primero convertía el audio a texto, procesaba la respuesta por separado y luego la convertía de nuevo a voz. Eso provocaba demoras y cortes cuando el usuario intentaba interrumpir.
GPT-Live usa una arquitectura full‑dúplex. El modelo procesa el audio entrante de forma continua y decide en milisegundos si debe escuchar, hablar, pausar o interrumpir. Esto permite:
- Que el usuario interrumpa a la IA sin esperar a que termine.
- Que la IA emita señales de atención como "ajá" o "claro" mientras el otro habla.
- Que espere si el usuario se queda en silencio pensando.
El dato clave
Para preguntas que requieren búsqueda web o razonamiento más profundo, GPT-Live delega la tarea a GPT‑5.5 en segundo plano. Mientras el modelo principal procesa la solicitud, GPT-Live sigue conversando con el usuario y entrega los resultados cuando están listos.
OpenAI afirma que GPT-Live es "el modelo de voz más inteligente hasta la fecha" de la compañía.
Lo que cambia
- Conversación natural: el modelo puede cambiar de tema al instante, responder a preguntas superpuestas y mostrar tarjetas visuales (clima, bolsa, deportes).
- Nuevas voces: OpenAI remasterizó los nueve tonos de voz disponibles en ChatGPT para que suenen más fluidos con GPT-Live.
- Disponibilidad: GPT-Live-1 es la opción predeterminada para usuarios Go, Plus y Pro; GPT-Live-1 mini para usuarios Free. Se despliega globalmente desde hoy.
Qué sigue
OpenAI trabaja en añadir compatibilidad con video y uso compartido de pantalla a GPT-Live, funciones que aún no están disponibles. La empresa también anticipa que la investigación detrás de este modelo permitirá usar la voz para tareas más largas y complejas en el futuro.