Aller au contenu
Français
Contenu FikirPilot

J’ai créé un avatar numérique interactif de moi-même ; vous pouvez lui parler

Mis à jour: 03/10/2026 · 4 min de lecture · 701 mots

Publié: · Dépêche reçue: · Durée de traitement: 101 h 46 min

J’ai créé un avatar numérique interactif de moi-même ; vous pouvez lui parler
Un avatar numérique sur un écran d’ordinateur

Alexandru Voica, responsable des relations institutionnelles de Synthesia, utilise un avatar interactif créé à partir de son image et de sa voix pour répondre aux questions de la presse concernant l’entreprise. La société basée au Royaume-Uni opère dans le domaine des avatars numériques aux côtés de start-up telles que D-ID, HeyGen et Colossyan. Il a été indiqué que Synthesia avait atteint une valorisation de 4 milliards de dollars au début de cette année et qu’elle avait annoncé avoir dépassé le seuil de 100 millions de dollars d’ARR l’année dernière.

L’entreprise permet aux sociétés de préparer des vidéos de formation avec des avatars d’intelligence artificielle. Avec son nouveau produit Roleplay Sessions, les employés peuvent répéter des scénarios tels que des présentations commerciales avec des avatars interactifs ; ceux-ci peuvent évaluer et noter leurs réponses.

Dominic-Madori Davis, journaliste de TechCrunch, a créé son propre avatar numérique dans les bureaux de Synthesia à New York. Pour cela, de nombreuses photos d’elle ont été prises et un enregistrement de deux minutes de sa voix a été réalisé. L’entreprise a préparé deux avatars personnels, avec et sans lunettes, ainsi que deux avatars interactifs. Alors que l’avatar personnel lit le texte qui lui est fourni, l’avatar interactif peut écouter et répondre. L’avatar interactif de Davis a été entraîné à partir de son article sur les raisons pour lesquelles les start-up soutenues par des investisseurs font davantage de fraude que les autres start-up, et a été conçu pour répondre uniquement aux questions sur ce sujet.

Le fonctionnement technologique de l’avatar se compose de quatre étapes :

  • Le modèle voix-texte convertit en texte ce que dit l’utilisateur.
  • Le modèle de langage fondé sur des agents interprète le texte et agit en conséquence.
  • Le modèle texte-voix convertit la réponse en voix.
  • Le modèle vidéo développé par Synthesia anime l’avatar lorsqu’il parle.

Les produits de Synthesia se répartissent en trois grandes catégories :

  • Une plateforme de création et de diffusion de vidéos dans lesquelles l’avatar lit le texte écrit par l’utilisateur.
  • Une plateforme fondée sur des agents appelée Sessions, qui propose des interactions telles que des sondages et des jeux de rôle.
  • Une plateforme API permettant d’intégrer les modèles vidéo et audio de l’entreprise à d’autres services.

En plus de ses propres modèles, l’entreprise autorise également l’utilisation des modèles de Cartesia, ElevenLabs, Google et OpenAI ; les entreprises peuvent héberger les avatars dans le cloud de leur choix ou utiliser le service d’hébergement de Synthesia.

La préparation des avatars a pris plusieurs jours. Davis a jugé la voix de l’avatar personnel plutôt réussie, tandis que ses amis ont trouvé l’apparence et la voix de l’avatar interactif quelque peu dérangeantes. L’avatar répondait uniquement aux questions concernant l’histoire de fraude de start-up pour laquelle il avait été entraîné ; il est également resté sans réponse aux questions personnelles de la famille de Davis.

Davis a indiqué que cette expérience soulevait la question de savoir si la confiance dans le journalisme pouvait être déléguée à l’intelligence artificielle. Il a déclaré qu’il pourrait être tentant que des copies numériques répondent aux questions au nom des utilisateurs pendant leurs vacances, mais qu’il éprouvait des sentiments complexes à l’égard de ses propres avatars.

Pourquoi c’est important

Cette évolution montre que les entreprises pourraient utiliser, dans les processus de formation et de répétition, des systèmes qui interagissent avec les employés plutôt que de simples vidéos visionnées. Ainsi, dans des applications telles que les présentations commerciales, les fonctions d’évaluation et de notation pourraient réduire la nécessité pour le formateur de participer au processus à chaque étape ; toutefois, le fait que l’avatar ne puisse répondre que dans le cadre du sujet défini à l’avance montre que ses domaines d’utilisation restent limités. L’utilisation de cette technologie dans le journalisme soulève quant à elle la question du rôle joué par la copie numérique d’une personne dans la transmission de l’information et de la mesure dans laquelle le public fera confiance à cette copie. Le fait que les avatars personnels puissent être hébergés sur différents clouds et que plusieurs options de modèles soient proposées crée une marge de choix technique pour les entreprises, tout en laissant ouverte la question de la manière dont les données et le pouvoir de représentation seront gérés.

Source: TechCrunch AI