Перейти к содержанию
Русский
Материал FikirPilot

Представлены Gemini 3.8 Live и 3.8 Live Extended Thinking

Обновлено: 15.09.2026 · 3 мин чтения · 426 слов

Опубликовано: · Новость поступила: · Время обработки: 2 ч 47 мин

Источник проверен:

Представлены Gemini 3.8 Live и 3.8 Live Extended Thinking
Телефон с цифровым экраном, лежащий на столе

Google представила модели Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, призванные сделать голосовое взаимодействие более естественным, плавным и интеллектуальным. Модели предлагают возможности сложного логического анализа, обработки визуального контекста в реальном времени и выполнения задач в фоновом режиме без прерывания разговора. С сегодняшнего дня пользователи могут получить доступ к моделям через Gemini API, Google Workspace и приложение Gemini.

Gemini 3.8 Live Extended Thinking заняла первое место в общем рейтинге Artificial Analysis Speech to Speech Quality Index, набрав 82,6 балла. В категории выполнения задач модель получила 68,6 % в τ-Voice, 35,1 % в тесте Sierra τ-Voice-banking и 97,7 % в Big Bench Audio. Gemini 3.8 Live заняла второе место в Speech Agent Arena. В оценке ServiceNow EVA-Bench модели улучшили границу Парето в сложных рабочих процессах, обеспечив баланс между точностью и качеством речи.

Gemini 3.8 Live обрабатывает визуальные данные практически в реальном времени, добавляя контекст в разговоры, и может во время беседы автоматически переключаться между 97 поддерживаемыми языками. Модель способна продолжать разговор, одновременно запуская инструменты и вызовы API в фоновом режиме. Используя визуальный контекст, она может помогать сотрудникам в процессе адаптации и играть в шахматы.

Gemini 3.8 Live Extended Thinking одновременно рассуждает и говорит, вслух сообщая о ходе выполнения многоэтапных задач. Модель может преобразовывать необработанные наброски и голосовые отзывы в функциональные компоненты React, а также с помощью диалога оформлять бронирования, подготавливать асинхронные вызовы функций, бизнес-планы и маркетинговые инструменты.

Модель доступна в Docs Live, Gmail Live и Keep Live. Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents поддерживают разработку голосовых интерфейсов с помощью Gemini Live API. Google также сотрудничает с Salesforce, Genspark и Lumeris. Все сгенерированные голоса маркируются с помощью SynthID, чтобы их можно было выявить в целях противодействия дезинформации.

Почему это важно

Этот анонс выводит использование голосового искусственного интеллекта за рамки простых вопросов и ответов, предлагая концепцию, которая объединяет визуальный контекст, использование инструментов и многоэтапные рабочие процессы в рамках одного взаимодействия. Поэтому он открывает новые возможности для применения, особенно для пользователей Google Workspace, разработчиков и компаний, создающих разговорные интерфейсы. Результаты моделей в различных тестах показывают, что Google одновременно оценивает баланс между качеством голоса и выполнением задач, однако остается неясным, насколько эти сравнения будут соответствовать повседневному использованию при выполнении таких задач, как бронирование, составление бизнес-плана или помощь в адаптации. Маркировка голосов с помощью SynthID призвана помочь отличать сгенерированный контент, однако то, как это повлияет на решения пользователей о доверии, также остается вопросом, за которым следует наблюдать.

Предыстория

Gemini — не новое имя в архиве FikirPilot: за последние 90 дней мы опубликовали 10 новостей, в которых упоминалось это название; самая свежая из них датирована 8 сентября 2026 года.

Источник: Google DeepMind