Gemini 3.8 Live with Live Avatar 将 Gemini 的实时对话能力与低延迟视频流相结合,为企业用户提供近乎实时的视觉通信体验。系统在聆听并观察对话的同时,通过动态头像进行回应,支持唇形同步、自然表情和流畅的对话衔接。它旨在让客户服务和互动式讲解等场景中的数字交流更加互动。
Gemini 3.8 Live with Live Avatar 已于今天在 Gemini Enterprise 中开放使用。该功能支持具有不同外观、声音和表达方式的角色,并能够同时处理视觉和音频输入。借助异步工具调用,系统可以在后台获取数据的同时继续对话,并通过不间断的交流完成酒店住客登记等复杂任务。
内置的多语言语音到语音同步功能,可在保持视频质量的同时,将唇部动作和表情适配至 97 种语言。除了现成头像外,企业还可以根据参考图像创建自己的头像;自定义头像目前仅通过企业白名单机制提供。输出内容会通过嵌入音频和视频中的 SynthID 水印变得可检测。详情可通过模型卡和 API 文档获取。
为什么重要
这项进展通过结合面部表情和唇形同步的视频界面,将人工智能交互带给企业用户。通过同时处理视觉和音频输入,并确保工具调用期间对话不会中断,系统能够让客户沟通中的信息获取与回应步骤保持在同一流程中。对 97 种语言的同步支持扩大了适用范围,使提供多语言服务的机构能够使用同一基础设施;但自定义头像创建选项受白名单机制限制,表明该功能并非向所有人开放。SynthID 水印有助于检测内容是否由人工智能生成,而企业将如何把该系统纳入哪些业务流程,以及采用哪些监管措施,仍是一个有待解决的实际应用问题。
背景
Gemini 并不是 FikirPilot 档案中的新名字:过去 90 天内,我们发布了 24 条提及这一名称的新闻;最新一条发布于 2026年10月3日。