GPT‑Live‑1 leva conversas de voz naturais e bidirecionais para a API. O modelo consegue ouvir e falar ao mesmo tempo; pode delegar tarefas a modelos e ferramentas com os quais é combinado para um raciocínio mais profundo e ações. Os desenvolvedores podem direcionar a experiência de voz de acordo com seus usuários, fluxos de trabalho e objetivos.
A capacidade do modelo de gerenciar interrupções foi considerada positiva pela Speak em avaliações iniciais. Ao oferecer mais tempo para os alunos pensarem antes da resposta do professor de idiomas, o GPT‑Live‑1 reduziu as interrupções em quase 80% em comparação com sistemas sequenciais anteriores. Ao contrário dos agentes de voz tradicionais, que dividem a conversa nas etapas de voz para texto, raciocínio e texto para voz, o GPT‑Live‑1 combina escuta e fala em um único modelo. Enquanto gerencia instantaneamente a resposta, a confirmação e as interrupções, ele pode continuar processos mais profundos em segundo plano.
Os desenvolvedores podem escolher modelos, ferramentas e a infraestrutura de agentes; Luna pode ser usada para agendamentos ou atualizações de pedidos em alto volume, enquanto Astra pode ser usada para problemas complexos de clientes. Assim, velocidade, custo e nível de raciocínio podem ser ajustados de acordo com a tarefa. GPT‑Live‑1 oferece transcrições de ASR e o texto das respostas; também oferece suporte a expressões alfanuméricas e à priorização de palavras-chave. Apesar de não ser um modelo sequencial, a detecção de troca de turnos também está integrada.
Nas avaliações, GPT‑Live‑1 aumentou em 30 pontos seu desempenho no Full Duplex Bench contra o GPT‑Realtime‑2.1. Ficou em primeiro lugar no Tau3 em raciocínio de nível médio com o GPT‑6 Astra. O modelo oferece uma variedade mais ampla de opções de voz em diferentes sotaques, dialetos e idiomas. Está disponível hoje na API ao preço de $0,05 por minuto para a camada de voz do frontend. Pode ser integrado ao Codex e ao OpenAI Presence; para ter acesso a vozes personalizadas, é necessário entrar em contato com a equipe de vendas.
Por que isso é importante
Essa abordagem é especialmente relevante para cenários de educação e atendimento ao cliente, nos quais a interação é interrompida com frequência, ao permitir gerenciar o fluxo de conversação em aplicações de voz sem dividi-lo em etapas separadas de reconhecimento, processamento e síntese de voz. A capacidade de lidar com escuta, resposta e tarefas em segundo plano dentro da mesma estrutura permite que os desenvolvedores criem diferentes componentes de acordo com as necessidades de velocidade, custo e raciocínio, em vez de um agente único. Os resultados das primeiras avaliações mostram que as comparações de desempenho medem não apenas a capacidade técnica, mas também a naturalidade da conversa e os tempos de espera. O fornecimento de transcrição e texto de resposta pela API facilita a conexão das interações de voz aos fluxos de trabalho existentes. No entanto, o custo total da cobrança por minuto em usos de alto volume e o fato de o acesso a vozes personalizadas depender do processo de vendas continuam sendo pontos em aberto que as equipes que avançarão para a implementação precisam avaliar separadamente.
Contexto
GPT não é um nome novo no arquivo do FikirPilot: publicamos 2 notícias com esse nome nos últimos 90 dias; a mais recente é de 13 de setembro de 2026.
Termo: agente
Um agente de inteligência artificial é um software que, em vez de produzir uma única resposta, chama ferramentas e executa um trabalho em várias etapas para alcançar um objetivo.