OpenAI presentó GPT-Live, el nuevo modo de voz de ChatGPT que promete transformar la manera en que las personas interactúan con la inteligencia artificial mediante conversaciones más fluidas y naturales.
El modelo, disponible las aplicaciones móviles en iOS, Android y la web, reemplaza al anterior Advanced Voice Mode con una arquitectura que permite escuchar y hablar al mismo tiempo.
PUBLICIDAD
A diferencia del sistema anterior, que funcionaba como un walkie-talkie, obligando a la IA a esperar un silencio limpio antes de responder, GPT-Live opera con una arquitectura que denominan full-duplex: procesa el audio entrante de forma continua mientras genera su propia respuesta hablada.
El modelo evalúa señales de interacción varias veces por segundo y decide si debe hablar, pausar, escuchar o delegar una tarea.

Los usuarios de los planes de pago —Go, Plus y Pro— acceden a GPT-Live-1, la versión completa del modelo. Los usuarios gratuitos reciben GPT-Live-1 mini como opción predeterminada.
Qué es GPT-Live y cómo funciona
La característica más visible del nuevo modelo es su capacidad de replicar los ritmos naturales de una conversación humana, explica OpenAI. Cuando el usuario se detiene a ordenar sus ideas, GPT-Live espera en lugar de interrumpir.
PUBLICIDAD
Cuando el usuario habla, el modelo puede responder con frases breves como “mmm” o “sí” para señalar que está siguiendo el hilo. Si hay ruido de fondo como tráfico o conversaciones cercanas, el sistema está entrenado para concentrarse en la voz del interlocutor y filtrar las distracciones.

OpenAI también rediseñó las nueve voces disponibles en ChatGPT para adaptarlas al nuevo modelo. Los usuarios pueden interrumpir al asistente con una pregunta, pedirle que baje el ritmo o solicitarle que escuche sin responder de inmediato.
Para qué sirve GPT-Live: tareas en paralelo y respuestas más inteligentes
La segunda innovación arquitectónica de GPT-Live es la separación entre la interacción continua y el procesamiento complejo. Cuando una consulta requiere búsqueda en la web, razonamiento profundo o capacidades más avanzadas, el modelo delega esa tarea a GPT-5.5 en segundo plano.
PUBLICIDAD
Mientras GPT-5.5 trabaja, GPT-Live mantiene la conversación activa y, una vez que el modelo de fondo entrega el resultado, lo integra al flujo del diálogo sin interrupciones visibles.

“Cuando GPT-Live tiene que pensar en una pregunta difícil, puede delegar el razonamiento y la tarea compleja a GPT-5.5 en paralelo, mientras GPT-Live sigue en conversación con el usuario”, explicó Kundan Kumar, investigador principal del proyecto.
Imagina que ChatGPT es una persona con varios cerebros especializados, cada uno dedicado a una tarea concreta. Cada modelo es uno de esos cerebros.
GPT-Live se ocupa de sostener la conversación; GPT-5.5, de resolver problemas complejos. Los dos trabajan al mismo tiempo, de modo que mientras la IA te sugiere atuendos para una boda, puede resolver en paralelo una ecuación matemática compleja sin que ninguna de las dos tareas interrumpa a la otra.
PUBLICIDAD
Respuestas visuales y niveles de razonamiento
GPT-Live incorpora también respuestas visuales durante la conversación. Mientras el usuario habla, ChatGPT puede mostrar tarjetas con información sobre el clima, cotizaciones bursátiles, resultados deportivos y otros temas que se benefician de una presentación gráfica.
El modo de voz conserva además el soporte para búsqueda web, memoria, imágenes y carga de archivos.
Para las consultas que exigen más elaboración, el sistema ofrece tres niveles de razonamiento: Instant, para respuestas rápidas; Medium; y High, cuando el usuario necesita que el asistente dedique más tiempo a pensar antes de responder.

Seguridad y limitaciones en el lanzamiento
OpenAI incorporó salvaguardas específicas para el modo de voz. El sistema puede detectar conversaciones potencialmente riesgosas, orientar al usuario hacia respuestas más seguras y ofrecer información de apoyo en crisis cuando el diálogo deriva hacia temas de autolesión.
PUBLICIDAD
La compañía también añadió protecciones para usuarios adolescentes y mecanismos que impiden que el modelo imite la voz de una persona real.
En el lanzamiento, GPT-Live no admite conversaciones de voz con video ni con uso compartido de pantalla.
OpenAI indicó que esas funciones están en desarrollo y que las versiones anteriores del modo de voz, Standard y Advanced Voice Mode, permanecen disponibles mientras tanto para los usuarios que las necesiten.
PUBLICIDAD
PUBLICIDAD
Últimas Noticias
Steam regala 4 nuevos juegos para PC este fin de semana: de terror cooperativo a ajedrez con magia
Ninguno de los títulos tiene anunciada una fecha límite para su acceso gratuito, aunque algunos incluyen compras opcionales dentro del juego

Google quiere garantizar el futuro de Gemini: invertirán USD 4.300 millones en 11 reactores nucleares
La compañía ofrecerá a Constellation Energy acceso a los servicios de Google Cloud y a Gemini Enterprise, en el marco de una alianza denominada AI for Energy

Satya Nadella, CEO de Microsoft, impone la regla de oro en IA para las empresas: “Si no se puede observar, no se puede confiar”
El CEO de Microsoft advierte que las garantías ofrecidas por el proveedor del modelo no eximen a la compañía que lo utiliza de asumir las consecuencias de sus actos

Warren Buffett revela su rutina nocturna: así pasa las horas en YouTube tras dejar Berkshire Hathaway
El inversor es reconocido en el mundo financiero por haber sido históricamente lento en la adopción de nuevas tecnologías

Robots humanoides en los supermercados: Dinamarca avanza en la automatización nocturna para aliviar la carga de los empleados
Máquinas entrenadas con inteligencia artificial aprenden a reponer estanterías mientras las tiendas permanecen cerradas, en un experimento que podría extenderse a más de 2.000 locales en Europa




