Google 推出了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,可在后台执行工具和 API 调用的同时继续对话。标准模型侧重可扩展性和成本效率,Extended Thinking 则专注于复杂的多步骤推理。模型支持97种语言的语言识别、语言切换、语音生成和视觉处理。演示展示了入职适应、国际象棋、React 开发和预订等示例。Extended Thinking 在 Speech to Speech Quality Index 中以82.6分超过竞争对手,而标准模型在 Speech Agent Arena 中位居第二。这些模型已在 Gemini API 和 Google AI Studio 中推出,并在 Gemini Enterprise 中进行专属预览;它们也将登陆 Search Live、Gemini Live 和 Workspace。语音中包含 SynthID。标准模型每分钟的输入价格为0.005美元,输出价格为0.018美元。
为何重要
在后台使用工具和 API 时保持对话不中断,可能会让预订、软件开发和企业工作流等语音交互运行得更加流畅。双版本架构让开发者能够在高用量场景下的成本与可扩展性,以及多步骤任务中的推理能力之间作出选择。多语言和视觉能力被引入 Search、Workspace 和 Gemini 产品,表明这一进展不仅与 API 用户有关,也涉及使用 Google 服务的更广泛群体。尽管公布的性能指标提供了比较依据,但仅凭这些指标无法说明演示在实际使用条件下的一致性。此外,仅公布标准版本的价格,也使 Extended Thinking 的使用成本仍不明确。
背景
Google 对 FikirPilot 的存档来说并不陌生:过去90天里,我们发布了41篇提及该名称的新闻报道;最新一篇发布于2026年9月15日。