本文へスキップ
日本語
FikirPilot の記事

自分自身のインタラクティブなデジタルアバターを作ってみた——会話できます

更新日: 2026年10月3日 · 5 分で読めます

公開: · 記事の受信: · 処理時間: 101 時間 46 分

自分自身のインタラクティブなデジタルアバターを作ってみた——会話できます
コンピューター画面に映るデジタルアバター

Synthesiaの企業関係責任者であるAlexandru Voicaは、同社に関する報道機関からの質問に答えるため、自身の映像と音声から作成された対話型アバターを使用している。英国を拠点とする同社は、デジタルアバター分野でD-ID、HeyGen、Colossyanなどのスタートアップとともに事業を展開している。Synthesiaは今年初めに$4 billionの評価額に達し、昨年にはARRが$100 millionを超えたと発表したという。

同社は、企業がAIアバターを使って研修動画を作成できるようにしている。新製品のRoleplay Sessionsでは、従業員が営業プレゼンテーションなどのシナリオを対話型アバターで練習でき、アバターは回答を評価して採点できる。

TechCrunchの記者であるDominic-Madori Davisは、Synthesiaのニューヨークオフィスで自身のデジタルアバターを作成した。そのために多数の写真を撮影し、音声を2分間録音した。同社は、眼鏡をかけたものとかけていないものの2種類のパーソナルアバターと、2種類の対話型アバターを作成した。パーソナルアバターが入力されたテキストを読み上げる一方、対話型アバターは話を聞いて応答できる。Davisの対話型アバターは、ベンチャー支援を受けたスタートアップが他のスタートアップと比べてなぜ詐欺を多く行うのかについての同氏の記事で学習され、このテーマに関する質問にのみ答えるよう設計された。

アバターの技術的な仕組みは、4つの段階で構成されている。

  • 音声・テキストモデルが、ユーザーの発言をテキストに変換する。
  • エージェントベースの言語モデルが、テキストを理解し、それに応じて処理を行う。
  • テキスト・音声モデルが、回答を音声に変換する。
  • Synthesiaが開発した動画モデルが、アバターが話しているように動かす。

Synthesiaの製品は、3つの主要グループに分けられる。

  • ユーザーが入力したテキストをアバターが読み上げる動画を作成・配信するプラットフォーム。
  • アンケートやロールプレイなどのインタラクションを提供する、Sessionsと呼ばれるエージェントベースのプラットフォーム。
  • 同社の動画モデルと音声モデルを他のサービスと組み合わせられるAPIプラットフォーム。

同社は自社モデルに加え、Cartesia、ElevenLabs、Google、OpenAIのモデルも利用できるようにしており、企業はアバターを希望するクラウドでホスティングすることも、Synthesiaのホスティングサービスを利用することもできる。

アバターの作成には数日かかった。Davisはパーソナルアバターの音声をかなり成功していると感じた一方、友人たちは対話型アバターの見た目と音声を少し不気味に感じた。アバターは、自身が学習したスタートアップ詐欺のストーリーに関する質問にしか答えず、Davisの家族からの個人的な質問にも回答しなかった。

Davisは、この体験によって、ジャーナリズムにおける信頼をAIに委ねられるのかという疑問が浮かび上がったと述べた。デジタルコピーが休暇中にユーザーに代わって質問に答えることは魅力的かもしれないが、自身のアバターについては複雑な感情を抱いていると語った。

なぜ重要なのか

この進展は、企業が研修やリハーサルの過程で、単に視聴するだけの動画ではなく、従業員と双方向にやり取りするシステムを利用できることを示している。これにより、営業プレゼンテーションのような実践において、評価や採点の機能が、講師があらゆる段階でプロセスに関与する必要性を減らす可能性がある。一方で、アバターがあらかじめ定められたテーマの範囲内でしか回答できないことは、利用範囲が依然として限られていることを示している。ジャーナリズムにおけるこの技術の利用は、ある人物のデジタルコピーが情報伝達において果たす役割と、視聴者がそのコピーをどの程度信頼するのかという問題を提起している。パーソナルアバターを異なるクラウドでホスティングでき、さまざまなモデルの選択肢が提供されることは、企業に技術的な選択の余地をもたらす一方、データと代理権限をどのように管理するのかという問題を未解決のまま残している。

出典: TechCrunch AI