ElevenLabs, qui développe des technologies vocales basées sur l’intelligence artificielle, a présenté ses modèles de synthèse vocale Eleven v4 et Eleven v4 Turbo. L’entreprise indique qu’Eleven v4, doté d’une architecture entièrement nouvelle, produit des voix plus naturelles en interprétant l’intonation, le rythme, les émotions, le caractère et le contexte ; le modèle peut préserver l’identité du locuteur dans les textes longs et modifier l’intonation en fonction des répliques précédentes. Plusieurs balises vocales peuvent être utilisées dans une même commande ; les rires, la colère, les accents et les sons d’ambiance peuvent être décrits en langage naturel. Une prise en charge améliorée de l’International Phonetic Alphabet (IPA) est également proposée.
Eleven v4 peut cloner une voix à partir d’un enregistrement de 10 secondes et réintroduit la fonctionnalité Professional Voice Clone, qui n’était pas disponible dans Eleven v3. Les deux modèles prennent en charge plus de 90 langues ; Eleven v3 en prenait en charge environ 70. Une amélioration de la qualité est visée en japonais, en portugais brésilien, en mandarin et en cantonais.
Eleven v4 Turbo a été développé pour les centres d’appels et les agents d’intelligence artificielle vocale. Grâce au streaming bidirectionnel, la génération commence plus tôt ; lors des tests de l’entreprise, la médiane du premier son était d’environ 150 millisecondes et la latence d’inférence d’environ 100 millisecondes. Eleven v4 peut générer du contenu allant jusqu’à 10 mille caractères.
Pourquoi est-ce important
La nouvelle architecture permet de préserver la cohérence des locuteurs dans les contenus longs et de gérer plusieurs éléments vocaux au moyen d’une seule commande, faisant passer le modèle au-delà des courtes voix off vers des flux de production plus complexes. Le passage d’environ 70 à plus de 90 langues élargit les objectifs d’accessibilité et de qualité, notamment pour les équipes qui utilisent le japonais, le portugais brésilien, le mandarin et le cantonais. Dans la version Turbo, l’accent mis sur le streaming bidirectionnel et la faible latence montre que le temps de réponse constitue l’un des principaux critères dans les centres d’appels et pour les agents d’intelligence artificielle vocale. Toutefois, le fait que les résultats de latence annoncés reposent sur les tests de l’entreprise laisse ouverte la question de savoir si les performances seront du même niveau avec différentes infrastructures et dans des conditions d’utilisation réelles. La proposition conjointe du clonage à partir d’un court échantillon et de l’option de clonage professionnel soulève également la question de la méthode que les utilisateurs choisiront en fonction de leurs exigences de qualité.
Contexte
ElevenLabs n’est pas un nouveau nom dans les archives de FikirPilot : au cours des 90 derniers jours, nous avons publié un article dans lequel ce nom apparaissait ; cet article est daté du 12 septembre 2026.