Synthesia的企业关系负责人Alexandru Voica使用了一个以自己的形象和声音创建的互动化身,以回答媒体有关公司的问题。这家总部位于英国的公司与D-ID、HeyGen和Colossyan等创业公司共同活跃于数字化身领域。据称,Synthesia在今年年初达到4 billion美元估值,并宣布其去年已超过100 million ARR。
该公司帮助企业利用人工智能化身制作培训视频。通过全新的Roleplay Sessions产品,员工可以使用互动化身演练销售演示等场景;化身能够评估回答并进行评分。
TechCrunch作者Dominic-Madori Davis在Synthesia位于纽约的办公室创建了自己的数字化身。为此,工作人员为她拍摄了大量照片,并录制了2分钟的声音。公司制作了2个个人化身和2个互动化身,分别对应佩戴眼镜和不戴眼镜的形象。个人化身会朗读输入的文本,而互动化身能够聆听并作出回答。Davis的互动化身接受了她关于风险投资支持的初创公司为何比其他初创公司更容易实施欺诈的文章训练,并被设计为只能回答与这一主题有关的问题。
化身的技术运行分为4个阶段:
- 语音转文本模型将用户说的话转换为文本。
- 基于智能体的语言模型理解文本,并据此执行操作。
- 文本转语音模型将回答转换为语音。
- 由Synthesia开发的视频模型让化身在说话时进行动态呈现。
Synthesia的产品分为3大类:
- 一个用于创建和分发视频的平台,视频中化身会朗读用户输入的文本。
- 名为Sessions的智能体平台,可提供问卷和角色扮演等互动。
- API平台,允许将公司的视频和语音模型与其他服务相结合。
除了自有模型外,该公司还允许使用Cartesia、ElevenLabs、Google和OpenAI的模型;企业可以将化身托管在自己选择的云端,也可以使用Synthesia的托管服务。
化身的制作耗时几天。Davis认为个人化身的声音相当成功,而她的朋友觉得互动化身的外观和声音有些令人不适。该化身只回答与其接受训练的创业公司欺诈故事有关的问题,也没有回答Davis家人提出的私人问题。
Davis表示,这一体验引发了一个问题:在新闻业中,信任是否可以交给人工智能。她还表示,数字复制体在用户休假期间代替用户回答问题或许很有吸引力,但她对自己的化身抱有复杂的情感。
为什么重要
这一进展表明,在培训和演练过程中,企业可以使用与员工进行互动的系统,而不只是使用供员工观看的视频。这样一来,在销售演示等实践中,评估和评分功能可以减少对培训师在每个阶段参与流程的需求;但化身只能在预先确定的主题范围内作答,这也表明其应用场景仍然有限。该技术在新闻业中的应用,则引发了关于一个人的数字复制体在信息传递中所扮演的角色,以及受众将在多大程度上信任这一复制体的问题。个人化身可以托管在不同的云端,并且可以提供多种模型选项,这为企业创造了技术选择空间,但数据和代理权限应如何管理的问题仍未解决。