OpenAI presenta GPT-Live: la nueva generación de modelos de voz con arquitectura full-dúplex
OpenAI ha lanzado este miércoles GPT-Live, una nueva familia de modelos de voz que promete transformar radicalmente la forma en que interactuamos con la inteligencia artificial. La gran innovación: una arquitectura full-dúplex que permite al modelo escuchar y hablar simultáneamente, eliminando las incómodas pausas y la estructura rígida de turnos que hasta ahora caracterizaban a los asistentes de voz.
¿Qué significa full-dúplex?
A diferencia de los sistemas anteriores —que funcionaban por turnos: el usuario habla, el modelo espera a que termine, y luego responde— GPT-Live procesa el audio de entrada de forma continua mientras genera su propia respuesta. Esto permite que la IA intercale expresiones como "mhm", "sí" o "entiendo" mientras el usuario sigue hablando, cree una conversación mucho más natural y fluida.
Esta arquitectura resuelve uno de los problemas más frustrantes del modo de voz avanzado anterior: el sistema solía confundir una pausa para pensar con el final del turno, interrumpiendo en momentos inoportunos. Con GPT-Live, el modelo puede decidir cientos de veces por segundo si debe hablar, seguir escuchando, hacer una pausa, interrumpir o invocar una herramienta.
Dos versiones disponibles
OpenAI ha lanzado dos variantes de GPT-Live:
- GPT-Live-1: versión completa, disponible para usuarios de ChatGPT Go, Plus y Pro.
- GPT-Live-1 mini: versión optimizada para usuarios gratuitos de ChatGPT.
Ambos modelos ya están disponibles a nivel global en iOS, Android y ChatGPT.com, y se están desplegando de forma progresiva a todos los usuarios. La compañía planea llevarlos también a su API próximamente, y los desarrolladores pueden registrarse para recibir notificaciones.
Inteligencia delegada: GPT-5.5 en segundo plano
Una de las innovaciones arquitectónicas más importantes es la separación entre la capa de interacción de voz y la capa de razonamiento. Cuando GPT-Live recibe una pregunta compleja que requiere búsqueda web, razonamiento profundo o tareas más elaboradas, delega el trabajo al modelo GPT-5.5 en segundo plano, mientras continúa manteniendo la conversación con el usuario.
Esto significa que GPT-Live puede estar procesando una consulta compleja mientras sigue interactuando de forma natural, y cuando el resultado está listo, lo incorpora a la conversación. A medida que OpenAI lance nuevos modelos, GPT-Live se actualizará automáticamente para usar los mejores motores de razonamiento disponibles.
Nuevas capacidades en ChatGPT Voice
Más de 150 millones de personas usan ChatGPT Voice cada semana y ahora recibirán una experiencia muy mejorada:
- Conversaciones más naturales: se puede interrumpir al modelo, hacer pausas, pedirle que hable más lento. El modelo responde con "mhm" y "entendido" para mostrar que sigue el hilo.
- Tarjetas visuales: mientras se conversa, ChatGPT puede mostrar información visual sobre el clima, acciones, deportes y más.
- Tres niveles de razonamiento: Instant (respuestas rápidas), Medium y High (para trabajo más complejo).
- Nueve voces remasterizadas: OpenAI ha rediseñado las voces de ChatGPT específicamente para GPT-Live.
- Mejor escucha: el modelo espera cuando el usuario necesita pensar y es más resistente al ruido ambiental.
Seguridad diseñada para voz
OpenAI ha desarrollado salvaguardas específicas para interacciones por voz, incluyendo la capacidad de intervenir mientras el modelo está hablando si se detecta contenido potencialmente problemático. El sistema puede redirigir la conversación, mostrar recursos de apoyo o finalizarla en casos de alto riesgo.
En las evaluaciones internas, GPT-Live-1 mostró mejoras sustanciales frente al Advanced Voice Mode anterior en categorías como comportamiento ilícito (de 0.63 a 0.97), autolesión (de 0.72 a 0.98) y discurso de odio (1.00 frente a 0.87).
El panorama competitivo
OpenAI no está sola en la carrera por la voz full-dúplex. Google ya ofrece Gemini Live con soporte full-dúplex y capacidad de cámara y pantalla compartida, ByteDance lanzó Seeduplex en abril dentro de su app Doubao, y Nvidia presentó PersonaPlex en enero. La ventaja de OpenAI radica en su base de usuarios existente y la integración con GPT-5.5.
GPT-Live representa el paso más significativo de OpenAI hacia la voz como interfaz principal para la IA. La compañía lo describe como "el comienzo de una nueva era de interacción persona-máquina", donde colaborar con IA se sienta tan fluido como trabajar con otra persona.
Fuente: OpenAI, VentureBeat, TechCrunch
