Zum Inhalt springen
Deutsch
FikirPilot-Inhalt

Ich habe einen interaktiven digitalen Avatar von mir erstellt; Sie können mit ihm sprechen

Aktualisiert: 03.10.2026 · 3 Min. Lesezeit · 585 Wörter

Veröffentlicht: · Meldung erreichte uns: · Verarbeitungszeit: 101 Std. 46 Min.

Ich habe einen interaktiven digitalen Avatar von mir erstellt; Sie können mit ihm sprechen
Digitaler Avatar auf einem Computerbildschirm

Der Leiter der Unternehmenskommunikation von Synthesia, Alexandru Voica, verwendet einen interaktiven Avatar, der mit seinem eigenen Bild und seiner Stimme erstellt wurde, um Pressefragen zum Unternehmen zu beantworten. Das Unternehmen mit Sitz im Vereinigten Königreich ist im Bereich digitaler Avatare gemeinsam mit Start-ups wie D-ID, HeyGen und Colossyan tätig. Es wurde mitgeteilt, dass Synthesia Anfang dieses Jahres eine Bewertung von $4 Milliarden erreicht und im vergangenen Jahr die Marke von $100 Millionen ARR überschritten hat.

Das Unternehmen ermöglicht es Firmen, mithilfe von KI-Avataren Schulungsvideos zu erstellen. Mit dem neuen Produkt Roleplay Sessions können Beschäftigte Szenarien wie Verkaufsgespräche mit interaktiven Avataren üben; die Avatare können die Antworten bewerten und mit Punkten versehen.

Die TechCrunch-Autorin Dominic-Madori Davis erstellte im New Yorker Büro von Synthesia ihren eigenen digitalen Avatar. Dafür wurden zahlreiche Fotos von ihr aufgenommen und eine zweiminütige Sprachaufnahme angefertigt. Das Unternehmen erstellte zwei persönliche Avatare – einen mit Brille und einen ohne – sowie zwei interaktive Avatare. Während der persönliche Avatar einen vorgegebenen Text vorliest, kann der interaktive Avatar zuhören und antworten. Davis’ interaktiver Avatar wurde mit ihrem Artikel darüber trainiert, warum von Wagniskapital unterstützte Start-ups im Vergleich zu anderen Start-ups häufiger Betrug begehen, und so konzipiert, dass er nur Fragen zu diesem Thema beantwortet.

Die technologische Funktionsweise des Avatars besteht aus vier Schritten:

  • Das Sprache-zu-Text-Modell wandelt die Aussagen des Nutzers in Text um.
  • Das agentenbasierte Sprachmodell interpretiert den Text und führt entsprechend eine Aktion aus.
  • Das Text-zu-Sprache-Modell wandelt die Antwort in Sprache um.
  • Das von Synthesia entwickelte Videomodell lässt den Avatar beim Sprechen lebensecht erscheinen.

Die Produkte von Synthesia lassen sich in drei Hauptgruppen einteilen:

  • Eine Plattform zur Erstellung und Verbreitung von Videos, in denen der Avatar vom Nutzer verfasste Texte vorliest.
  • Eine agentenbasierte Plattform namens Sessions, die Interaktionen wie Umfragen und Rollenspiele ermöglicht.
  • Eine API-Plattform, die es ermöglicht, die Video- und Audiomodelle des Unternehmens mit anderen Diensten zu verbinden.

Das Unternehmen erlaubt neben seinen eigenen Modellen auch die Nutzung der Modelle von Cartesia, ElevenLabs, Google und OpenAI; Unternehmen können die Avatare in einer beliebigen Cloud hosten oder den Hosting-Service von Synthesia nutzen.

Die Erstellung der Avatare dauerte mehrere Tage. Davis fand die Stimme des persönlichen Avatars ziemlich gelungen, während seine Freunde das Aussehen und die Stimme des interaktiven Avatars etwas beunruhigend fanden. Der Avatar beantwortete nur Fragen zu der Geschichte über Start-up-Betrug, mit der er trainiert worden war; auch die persönlichen Fragen von Davis’ Familie ließ er unbeantwortet.

Davis erklärte, dass dieses Experiment die Frage aufgeworfen habe, ob Vertrauen im Journalismus an künstliche Intelligenz übertragen werden könne. Er erklärte, dass es attraktiv sein könne, wenn digitale Kopien während des Urlaubs im Namen des Nutzers Fragen beantworten, dass er jedoch ambivalente Gefühle gegenüber den eigenen Avataren habe.

Warum das wichtig ist

Diese Entwicklung zeigt, dass Unternehmen in Schulungs- und Übungsprozessen anstelle von Videos, die lediglich angesehen werden, Systeme einsetzen könnten, die mit den Mitarbeitenden interagieren. Dadurch könnten Bewertungs- und Punktvergabefunktionen bei Anwendungen wie Verkaufspräsentationen den Bedarf verringern, dass der Trainer in jeder Phase in den Prozess eingebunden ist; die Tatsache, dass der Avatar nur innerhalb eines zuvor festgelegten Themenrahmens antworten kann, zeigt jedoch, dass seine Einsatzmöglichkeiten weiterhin begrenzt sind. Der Einsatz der Technologie im Journalismus wirft wiederum die Frage auf, welche Rolle die digitale Kopie einer Person bei der Wissensvermittlung spielt und in welchem Maß das Publikum dieser Kopie vertrauen wird. Dass persönliche Avatare in verschiedenen Clouds gehostet werden können und unterschiedliche Modelloptionen zur Verfügung stehen, eröffnet Unternehmen technische Wahlmöglichkeiten, lässt jedoch die Frage offen, wie Daten und die Befugnis zur Repräsentation verwaltet werden sollen.

Quelle: TechCrunch AI