Google a présenté les modèles Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking, qui visent à rendre les interactions vocales plus naturelles, fluides et intelligentes. Ces modèles proposent des fonctionnalités de raisonnement complexe, de contexte visuel en temps réel et d’exécution de tâches en arrière-plan sans interrompre la conversation. Les utilisateurs peuvent y accéder dès aujourd’hui via Gemini API, Google Workspace et l’application Gemini.
Gemini 3.8 Live Extended Thinking s’est classé premier au classement général du Speech to Speech Quality Index d’Artificial Analysis avec un score de 82,6. Dans le domaine de l’accomplissement des tâches, le modèle a obtenu 68,6 % sur τ-Voice, 35,1 % au test τ-Voice-banking de Sierra et 97,7 % sur Big Bench Audio. Gemini 3.8 Live s’est classé deuxième dans la Speech Agent Arena. Lors de l’évaluation EVA-Bench de ServiceNow, les modèles ont fait progresser la frontière de Pareto dans les flux de travail complexes en trouvant un équilibre entre précision et qualité des conversations.
Gemini 3.8 Live traite les entrées visuelles presque en temps réel afin d’ajouter du contexte aux conversations et peut basculer automatiquement entre les 97 langues prises en charge au cours d’un échange. Il peut poursuivre la conversation tout en exécutant des outils et des appels API en arrière-plan. Grâce au contexte visuel, il peut guider les employés durant leur processus d’intégration et jouer aux échecs.
Gemini 3.8 Live Extended Thinking, quant à lui, réfléchit et parle simultanément, en exposant oralement sa progression dans les tâches à plusieurs étapes. Il peut transformer des croquis bruts et des retours vocaux en composants React fonctionnels ; il peut également préparer, par la conversation, des réservations, des appels de fonctions asynchrones, des plans de travail et des outils marketing.
Le modèle est disponible dans Docs Live, Gmail Live et Keep Live. Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel et Vision Agents permettent de développer des interfaces vocales avec Gemini Live API. Google travaille également avec Salesforce, Genspark et Lumeris. Toutes les voix générées sont marquées avec SynthID afin de pouvoir être détectées pour lutter contre la désinformation.
Pourquoi est-ce important ?
Cette annonce propose un cadre qui fait sortir l’utilisation de l’intelligence artificielle vocale du simple registre des questions-réponses, en réunissant dans une même interaction le contexte visuel, l’utilisation d’outils et les flux de travail en plusieurs étapes. Elle ouvre ainsi de nouvelles possibilités d’application, notamment pour les utilisateurs de Google Workspace, les développeurs et les entreprises qui créent des interfaces conversationnelles. Les résultats obtenus par les modèles dans différents tests montrent que Google évalue conjointement l’équilibre entre la qualité vocale et l’accomplissement des tâches ; toutefois, on ignore encore dans quelle mesure ces comparaisons se traduiront, dans l’usage quotidien, par des tâches telles que les réservations, la planification du travail ou l’accompagnement à l’intégration. Le marquage des voix avec SynthID vise à faciliter l’identification des contenus générés, mais son influence sur les décisions des utilisateurs en matière de confiance reste également à surveiller.
Contexte
Gemini n’est pas un nouveau nom dans les archives de FikirPilot : au cours des 90 derniers jours, nous avons publié 10 articles mentionnant ce nom ; le plus récent date du 8 septembre 2026.