Google宣布了 Gemini 3.8 Live 的 Live Avatar 功能。根据9月24日的声明,该系统将语音回复与低延迟视频相结合,使虚拟角色能够呈现说话时的唇部动作和面部表情。首批访问权限通过 Gemini Enterprise 提供;该功能面向客户服务和互动式产品讲解等企业应用场景。
Live Avatar 能够同步处理听觉和视觉输入,在调用工具期间保持对话继续进行,并支持根据97种语言的语音调整唇部动作和面部表情。
为何重要
这一进展将企业人工智能交互从单纯的语音回复层面,提升为包含视觉交流的体验。在客户服务和产品讲解中,用户与系统沟通的方式正在发生变化,而面部表情和唇部动作则构成了可能影响回复感知方式的新层面。视觉和听觉输入的同步处理,以及在调用工具期间不中断对话,使该功能能够适用于持续进行的交流,而不是仅适用于一次性回复。尽管支持97种语言扩大了覆盖范围,但首批服务仅限于 Gemini Enterprise,这使得该功能能够触达哪些用户群体、触达程度如何,仍有待明确。
背景
Google并不是 FikirPilot 档案中的新名字:在过去90天内,我们已发布59篇提及该名称的新闻;最新一篇的日期为2026年9月24日。