GPT‑Live‑1 lleva las conversaciones de voz naturales y bidireccionales a la API. El modelo puede escuchar y hablar al mismo tiempo; también puede delegar tareas en modelos y herramientas con los que se combina para un razonamiento más profundo y acciones. Los desarrolladores pueden orientar la experiencia de voz según sus usuarios, flujos de trabajo y objetivos.
La capacidad del modelo para gestionar las interrupciones fue valorada positivamente por Speak en las primeras evaluaciones. GPT‑Live‑1 redujo las interrupciones casi un 80 % frente a los sistemas secuenciales anteriores, al proporcionar más tiempo para que los estudiantes pensaran antes de la respuesta del instructor de idiomas. A diferencia de los agentes de voz tradicionales, que dividen la conversación en las etapas de voz a texto, razonamiento y texto a voz, GPT‑Live‑1 combina la escucha y el habla en un único modelo. Puede continuar procesos más profundos en segundo plano mientras gestiona al instante las respuestas, las confirmaciones y las interrupciones.
Los desarrolladores pueden elegir los modelos, las herramientas y la infraestructura de agentes; Luna puede utilizarse para programaciones o actualizaciones de pedidos de gran volumen, y Astra para problemas complejos de clientes. De este modo, la velocidad, el coste y el nivel de razonamiento pueden ajustarse según la tarea. GPT‑Live‑1 ofrece transcripciones de ASR y el texto de las respuestas, y admite expresiones alfanuméricas y la priorización de palabras clave. Aunque no es un modelo secuencial, también incorpora la detección de turnos.
En las evaluaciones, GPT‑Live‑1 aumentó en 30 puntos su rendimiento en Full Duplex Bench frente a GPT‑Realtime‑2.1. Quedó en primer lugar en Tau3 en razonamiento de nivel medio con GPT‑6 Astra. El modelo ofrece una mayor variedad de opciones de voz en distintos acentos, dialectos e idiomas. Ya está disponible en la API a un precio de $0,05 por minuto para la capa de voz del frontend. Puede integrarse con Codex y OpenAI Presence; para acceder a voces personalizadas es necesario ponerse en contacto con el equipo de ventas.
Por qué es importante
Este enfoque resulta especialmente relevante para los escenarios educativos y de atención al cliente, en los que la interacción se interrumpe con frecuencia, ya que permite gestionar el flujo de la conversación en aplicaciones de voz sin dividirlo en pasos separados de reconocimiento, procesamiento y síntesis de voz. El hecho de que pueda abordar la escucha, la respuesta y las tareas en segundo plano dentro de una misma estructura permite a los desarrolladores crear distintos componentes según las necesidades de velocidad, coste y razonamiento, en lugar de utilizar un agente único. Los resultados de las primeras evaluaciones muestran que las comparaciones de rendimiento miden no solo la capacidad técnica, sino también la naturalidad de la conversación y los tiempos de espera. El hecho de que la API proporcione la transcripción y el texto de respuesta facilita la conexión de las interacciones de voz con los flujos de trabajo existentes. Sin embargo, el coste total de la tarifa por minuto en usos de gran volumen y el hecho de que el acceso a voces personalizadas dependa del proceso de ventas siguen siendo cuestiones pendientes que los equipos que vayan a poner la solución en práctica deberán evaluar por separado.
Antecedentes
GPT no es un nombre nuevo en el archivo de FikirPilot: en los últimos 90 días publicamos 2 noticias en las que aparece este nombre; la más reciente está fechada el 13 de septiembre de 2026.
Término: agente
Un agente de inteligencia artificial es un software que, en lugar de generar una única respuesta, llama a herramientas y ejecuta tareas de varios pasos para alcanzar un objetivo.