GPT‑Live‑1 将自然、双向的语音对话引入 API。该模型可以同时聆听和说话,还能将任务交给与其搭配的模型和工具,以进行更深入的推理和执行操作。开发者可以根据用户、工作流程和目标来调整语音体验。
在早期评估中,Speak 对该模型处理中断的能力给予了积极评价。GPT‑Live‑1 会在语言教师回答之前给学生留出更多思考时间,与此前的串行系统相比,几乎减少了 80% 的中断。传统语音智能体会将对话拆分为语音转文本、推理和文本转语音等阶段,而 GPT‑Live‑1 则将聆听和说话整合到单一模型中。它可以实时处理回应、确认和中断,同时在后台继续进行更深入的处理。
开发者可以选择模型、工具和智能体基础设施;Luna 可用于大批量的日程安排或订单更新,Astra 则可用于复杂的客户问题。这样一来,速度、成本和推理水平都能根据任务进行调整。GPT‑Live‑1 提供 ASR 转录和回复文本,并支持字母数字表达以及关键词优先处理。尽管它并非串行模型,但仍内置了话轮检测功能。
在评估中,与 GPT‑Realtime‑2.1 相比,GPT‑Live‑1 的 Full Duplex Bench 表现提高了 30 分。在采用 GPT‑6 Astra 进行中等程度推理时,它在 Tau3 中排名第一。该模型针对不同口音、方言和语言提供了更广泛的语音选项。它现已可通过 API 使用,前端语音层的价格为每分钟 $0.05。它可以与 Codex 和 OpenAI Presence 集成;如需访问定制语音,必须联系销售团队。
为何重要
这种方法无需将语音应用中的对话流程拆分为独立的识别、处理和语音合成步骤即可进行管理,因此尤其适用于互动经常被打断的教育和客户服务场景。它能够在同一架构中处理聆听、回应和后台任务,使开发者不必采用单一类型的智能体,而是可以根据速度、成本和推理需求构建不同的组件。早期评估的结果表明,性能对比衡量的不仅是技术能力,也包括对话的自然程度和等待时间。API 提供转录文本和回复文本,有助于将语音交互接入现有工作流程。不过,按分钟计费在高频使用场景下产生的总成本,以及定制语音访问依赖销售流程,仍是计划投入应用的团队需要另行评估的关键问题。
背景
GPT 并不是 FikirPilot 档案中的新名字:在过去 90 天内,我们发布了 2 篇提及该名称的新闻;最新一篇发表于 2026年9月13日。
术语:智能体
人工智能智能体是一种软件,它不会只生成单一回复,而是会调用工具并执行多步骤任务,以实现目标。