Google представила модели Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, призванные сделать голосовое взаимодействие более естественным, плавным и интеллектуальным. Модели предлагают возможности сложного логического анализа, обработки визуального контекста в реальном времени и выполнения задач в фоновом режиме без прерывания разговора. С сегодняшнего дня пользователи могут получить доступ к моделям через Gemini API, Google Workspace и приложение Gemini.
Gemini 3.8 Live Extended Thinking заняла первое место в общем рейтинге Artificial Analysis Speech to Speech Quality Index, набрав 82,6 балла. В категории выполнения задач модель получила 68,6 % в τ-Voice, 35,1 % в тесте Sierra τ-Voice-banking и 97,7 % в Big Bench Audio. Gemini 3.8 Live заняла второе место в Speech Agent Arena. В оценке ServiceNow EVA-Bench модели улучшили границу Парето в сложных рабочих процессах, обеспечив баланс между точностью и качеством речи.
Gemini 3.8 Live обрабатывает визуальные данные практически в реальном времени, добавляя контекст в разговоры, и может во время беседы автоматически переключаться между 97 поддерживаемыми языками. Модель способна продолжать разговор, одновременно запуская инструменты и вызовы API в фоновом режиме. Используя визуальный контекст, она может помогать сотрудникам в процессе адаптации и играть в шахматы.
Gemini 3.8 Live Extended Thinking одновременно рассуждает и говорит, вслух сообщая о ходе выполнения многоэтапных задач. Модель может преобразовывать необработанные наброски и голосовые отзывы в функциональные компоненты React, а также с помощью диалога оформлять бронирования, подготавливать асинхронные вызовы функций, бизнес-планы и маркетинговые инструменты.
Модель доступна в Docs Live, Gmail Live и Keep Live. Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents поддерживают разработку голосовых интерфейсов с помощью Gemini Live API. Google также сотрудничает с Salesforce, Genspark и Lumeris. Все сгенерированные голоса маркируются с помощью SynthID, чтобы их можно было выявить в целях противодействия дезинформации.
Почему это важно
Этот анонс выводит использование голосового искусственного интеллекта за рамки простых вопросов и ответов, предлагая концепцию, которая объединяет визуальный контекст, использование инструментов и многоэтапные рабочие процессы в рамках одного взаимодействия. Поэтому он открывает новые возможности для применения, особенно для пользователей Google Workspace, разработчиков и компаний, создающих разговорные интерфейсы. Результаты моделей в различных тестах показывают, что Google одновременно оценивает баланс между качеством голоса и выполнением задач, однако остается неясным, насколько эти сравнения будут соответствовать повседневному использованию при выполнении таких задач, как бронирование, составление бизнес-плана или помощь в адаптации. Маркировка голосов с помощью SynthID призвана помочь отличать сгенерированный контент, однако то, как это повлияет на решения пользователей о доверии, также остается вопросом, за которым следует наблюдать.
Предыстория
Gemini — не новое имя в архиве FikirPilot: за последние 90 дней мы опубликовали 10 новостей, в которых упоминалось это название; самая свежая из них датирована 8 сентября 2026 года.