Глава отдела корпоративных связей Synthesia Alexandru Voica использует интерактивный аватар, созданный на основе его собственного изображения и голоса, чтобы отвечать на вопросы прессы о компании. Компания, базирующаяся в Великобритании, работает в сфере цифровых аватаров вместе с такими стартапами, как D-ID, HeyGen и Colossyan. Сообщается, что в начале этого года оценка Synthesia достигла $4 billion, а в прошлом году компания объявила о превышении показателя в $100 million ARR.
Компания позволяет предприятиям создавать обучающие видео с помощью аватаров на базе искусственного интеллекта. В новом продукте Roleplay Sessions сотрудники могут репетировать такие сценарии, как презентации для продаж, с интерактивными аватарами; аватары могут оценивать и выставлять баллы за ответы.
Автор TechCrunch Dominic-Madori Davis создала собственный цифровой аватар в офисе Synthesia в New York. Для этого её сфотографировали множество раз и записали два минуты её голоса. Компания подготовила два персональных аватара — в очках и без очков — и два интерактивных аватара. Персональный аватар читает предоставленный текст, а интерактивный может слушать и отвечать. Интерактивный аватар Davis был обучен на её статье о том, почему стартапы, поддержанные венчурными инвестициями, чаще совершают мошенничество по сравнению с другими стартапами, и был разработан так, чтобы отвечать только на вопросы по этой теме.
Технологическая работа аватара состоит из четырёх этапов:
- Модель преобразования речи в текст переводит слова пользователя в текст.
- Языковая модель на основе агентов интерпретирует текст и выполняет соответствующее действие.
- Модель преобразования текста в речь переводит ответ в звук.
- Разработанная Synthesia видеомодель оживляет аватара во время разговора.
Продукты Synthesia разделены на три основные группы:
- Платформа для создания и распространения видео, в котором аватар читает текст, написанный пользователем.
- Платформа на основе агентов под названием Sessions, обеспечивающая такие интерактивные возможности, как опросы и ролевые игры.
- API-платформа, позволяющая объединять видео- и аудиомодели компании с другими сервисами.
Помимо собственных моделей, компания также разрешает использовать модели Cartesia, ElevenLabs, Google и OpenAI; предприятия могут размещать аватаров в любом облаке по своему выбору или пользоваться услугой хостинга Synthesia.
Подготовка аватаров заняла несколько дней. Дэвис счёл голос персонального аватара весьма удачным, тогда как его друзья сочли внешний вид и голос интерактивного аватара немного жуткими. Аватар отвечал только на вопросы, связанные с историей о мошенничестве в стартапе, для которой его обучили, и оставлял без ответа личные вопросы членов семьи Дэвиса.
Дэвис отметил, что этот опыт поднимает вопрос о том, можно ли передать доверие в журналистике искусственному интеллекту. Он сообщил, что возможность отвечать от имени пользователя на вопросы во время отпуска с помощью цифровых копий может быть привлекательной, однако испытывает сложные чувства по отношению к собственным аватарам.
Почему это важно
Это развитие показывает, что компании могут использовать в процессах обучения и репетиций системы, взаимодействующие с сотрудником, вместо лишь просматриваемых видеозаписей. Благодаря этому в таких практических задачах, как презентация продаж, функции оценки и выставления баллов могут снизить потребность в постоянном участии тренера на каждом этапе процесса; однако возможность аватара отвечать только в рамках заранее определённой темы свидетельствует о том, что сферы его применения по-прежнему ограничены. Использование технологии в журналистике, в свою очередь, поднимает вопрос о роли цифровой копии человека в передаче информации и о том, в какой степени аудитория будет доверять этой копии. Возможность размещать персональные аватары в разных облачных средах и предлагать различные варианты моделей создаёт для предприятий пространство для технического выбора, однако оставляет открытым вопрос о том, как будут управляться данные и полномочия на представление.