GPT Live: ChatGPT puede escuchar mientras habla
OpenAI lanzó GPT Live, una arquitectura de voz full-dúplex que permite a ChatGPT escuchar interrupciones, cambiar velocidad y señalar cuando está atento, eliminando el patrón rígido de turno a turno que marcaba versiones anteriores.
OpenAI presentó GPT Live, la reescritura más profunda de su capacidad de conversación por voz desde que introdujo el modo de audio en ChatGPT. A diferencia de versiones anteriores, que funcionaban con un intercambio secuencial (usuario habla, espera, ChatGPT responde, espera), GPT Live usa una arquitectura que permite diálogo simultáneo: el usuario puede interrumpir mientras ChatGPT está hablando y el modelo responde a esa interrupción sin reiniciar.
La arquitectura de full-dúplex (comunicación bidireccional simultánea) cambia la experiencia táctil. El usuario puede pedirle al modelo que vaya más despacio, que repita un punto o que profundice en un tema mientras ChatGPT está en medio de una explicación, y la respuesta es inmediata. El modelo también señala activamente cuándo está escuchando, reduciendo la incertidumbre que existe en sistemas anteriores sobre si el sistema te oye de verdad.
La limitación histórica de sistemas de voz anteriores era la latencia y la rigidez. Cada turno requería procesamiento: transcribir audio, generar respuesta, sintetizar voz. GPT Live comprime estos pasos al usar un modelo entrenado para anticipar interrupciones y procesar entrada de audio en paralelo, no en serie. Greg Brockman, cofundador de OpenAI, lideró el anuncio, sugiriendo que se trata de un cambio fundamental en la interfaz, no solo una mejora incremental.
En contexto histórico, sistemas de voz previos (Alexa, Google Assistant) también permitían interrupciones, pero con pausas perceptibles y menor precisión en la comprensión de lo que el usuario decía mientras el asistente hablaba. GPT Live invierte la ecuación: el modelo está diseñado asumiendo que será interrumpido, no que sea una excepción.
Quedan preguntas sin respuesta clara. No hay datos públicos sobre latencia real, precisión de interrupciones en ruido ambiental, o si la experiencia degrada con conexiones lentas. Tampoco está confirmado si el sistema es comparable en fluidez a una conversación humana real o si mantiene características del patrón turno a turno bajo ciertos umbrales de interrupción.
El cambio es relevante porque rediseña un punto de fricción: la interacción por voz es, en teoría, más natural que texto, pero solo si se parece a cómo habla la gente. GPT Live reduce la brecha. Si estabiliza en calidad y latencia, podría hacer que ChatGPT por voz sea opción viable para usuarios que hoy prefieren interfaces de texto por precisión.
Ver la fuente original ↗