Googleは、ツールやAPIの呼び出しをバックグラウンドで実行しながら会話を継続できるGemini 3.8 LiveとGemini 3.8 Live Extended Thinkingを発表した。標準モデルはスケーラビリティとコスト効率に、Extended Thinkingは複雑で多段階の推論に重点を置いている。両モデルは97言語で、言語の検出、切り替え、音声生成、画像処理に対応する。デモでは、業務適応、チェス、React開発、予約の事例が披露された。Extended ThinkingはSpeech to Speech Quality Indexで82.6点を獲得して競合を上回り、標準モデルはSpeech Agent Arenaで2位となった。両モデルはGemini APIとGoogle AI Studioで提供され、Gemini Enterpriseでは限定プレビューとして提供されているほか、Search Live、Gemini Live、Workspaceにも導入される。音声にはSynthIDが組み込まれている。標準モデルの1分当たりの料金は、入力が0.005ドル、出力が0.018ドル。
なぜ重要なのか
バックグラウンドでツールやAPIを使用している間も会話が途切れないことで、予約、ソフトウェア開発、企業のワークフローなどにおける音声インタラクションを、より円滑に進められる可能性がある。2つのバージョンを用意する構成により、開発者は、大規模利用時のコストとスケーラビリティ、多段階タスクでの推論能力のどちらを重視するか選択できる。多言語機能と画像処理機能がSearch、Workspace、Gemini製品に導入されることは、この進展がAPIユーザーだけでなく、Googleのサービスを利用するより幅広い層にも関係することを示している。公表された性能指標は比較の基準となるものの、デモだけでは実際の利用条件における一貫性を明らかにできない。また、標準モデルの料金しか公表されていないため、Extended Thinkingの利用コストは不明なままとなっている。
背景
GoogleはFikirPilotのアーカイブでは新しい名前ではない。過去90日間に、この名前が登場する記事を41本掲載しており、最新の記事は2026年9月15日付だ。