Google 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 模型,旨在让语音交互更加自然、流畅和智能。这些模型支持复杂推理、实时视觉上下文,以及在不中断对话的情况下在后台执行任务。用户现在可以通过 Gemini API、Google Workspace 和 Gemini 应用使用这些模型。
Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 中以 82.6 分位居总榜首位。在任务完成方面,该模型在 τ-Voice 中获得 68.6%,在 Sierra 的 τ-Voice-banking 测试中获得 35.1%,在 Big Bench Audio 中则获得 97.7%。Gemini 3.8 Live 在 Speech Agent Arena 中排名第二。这些模型在 ServiceNow 的 EVA-Bench 评测中兼顾准确率和对话质量,改善了复杂工作流程中的 Pareto Frontier。
Gemini 3.8 Live 能以接近实时的速度处理视觉输入,为对话补充上下文,并可在交谈过程中自动切换其支持的 97 种语言。它可以在后台运行工具和 API 调用的同时继续对话。它还能结合视觉上下文指导员工完成入职适应流程,并可以下国际象棋。
Gemini 3.8 Live Extended Thinking 则可以同时思考和说话,以语音方式说明多阶段任务的推进过程。它能够将原始草图和语音反馈转化为可用的 React 组件;还可以通过对话完成预订,并准备异步函数调用、商业计划和营销工具。
该模型可用于 Docs Live、Gmail Live 和 Keep Live。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 支持使用 Gemini Live API 开发语音界面。Google 还与 Salesforce、Genspark 和 Lumeris 合作。所有生成的语音都会使用 SynthID 进行标记,以便在应对虚假信息时能够被识别。
为何重要
这项公告提供了一个框架,使语音人工智能的应用不再局限于问答,而是将视觉上下文、工具使用和多阶段工作流程整合到同一次交互中。因此,它尤其为 Google Workspace 用户、开发者以及构建对话式界面的企业创造了新的应用可能。模型在不同测试中的结果表明,Google 同时衡量了语音质量与任务完成情况之间的平衡;但这些评测能在多大程度上反映预订、商业计划或合规指导等任务中的日常使用表现,仍不明确。使用 SynthID 标记语音旨在帮助区分生成内容,而这将如何影响用户的信任判断,也是一个需要持续关注的问题。
背景
Gemini 对 FikirPilot 档案来说并不是一个新名字:过去 90 天内,我们发布了 10 篇提及该名称的新闻,其中最新一篇发布于 2026 年 9 月 8 日。