ElevenLabs是一家开发人工智能支持的语音技术的公司,推出了文本转语音模型Eleven v4和Eleven v4 Turbo。公司表示,采用全新架构的Eleven v4能够解读语调、节奏、情绪、角色和上下文,从而生成更自然的语音;在较长文本中,该模型能够保持说话者身份,并根据之前的台词调整语调。模型还支持在同一指令中使用多个语音标签;笑声、愤怒、口音和环境音都可以用自然语言进行描述。此外,模型还提供了改进的国际音标(IPA)支持。
Eleven v4可以通过10秒的录音克隆声音,并重新推出Eleven v3中没有的Professional Voice Clone功能。两种模型均支持90多种语言;Eleven v3支持约70种语言。模型计划提升日语、巴西葡萄牙语、普通话和粤语的质量。
Eleven v4 Turbo是为呼叫中心和语音人工智能代理开发的。借助双向streaming,模型可以更早开始生成语音;在公司的测试中,首次发声的中位时间约为150毫秒,推理延迟约为100毫秒。Eleven v4可以生成最多10千字符的内容。
为何重要
凭借全新架构,该模型能够在较长内容中保持说话者一致性,并在单条指令中管理多个语音要素,这使其应用范围超越了短篇语音生成,拓展至更复杂的生成流程。语言覆盖范围从约70种扩大到90多种,尤其扩大了使用日语、巴西葡萄牙语、普通话和粤语的团队在可用性和质量方面的目标。Turbo版本对双向streaming和低延迟的关注,表明响应时间是呼叫中心和语音人工智能代理的关键指标之一。然而,所公布的延迟结果基于公司测试,因此在不同基础设施和实际使用条件下能否达到同等水平,仍有待观察。将通过短音频样本克隆和Professional Voice Clone两种选项同时提供,也凸显了用户将在何种质量要求下选择哪种方式的问题。
背景
ElevenLabs并不是FikirPilot档案中的新名字:过去90天内,我们曾发布过一篇提及这一名称的新闻;该文章的日期是2026年9月12日。