Zum Inhalt springen
Deutsch
FikirPilot-Inhalt

Gemini 3.8 Live und 3.8 Live Extended Thinking werden vorgestellt

Aktualisiert: 15.09.2026 · 3 Min. Lesezeit · 442 Wörter

Veröffentlicht: · Meldung erreichte uns: · Verarbeitungszeit: 2 Std. 47 Min.

Quelle zuletzt geprüft:

Gemini 3.8 Live und 3.8 Live Extended Thinking werden vorgestellt
Telefon mit digitalem Display auf einem Tisch

Google hat die Modelle Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking vorgestellt, die Sprachinteraktionen natürlicher, flüssiger und intelligenter machen sollen. Die Modelle bieten komplexes logisches Denken, visuellen Kontext in Echtzeit und die Möglichkeit, Aufgaben im Hintergrund auszuführen, ohne das Gespräch zu unterbrechen. Nutzer können ab heute über die Gemini API, Google Workspace und die Gemini-App auf die Modelle zugreifen.

Gemini 3.8 Live Extended Thinking belegte im Speech to Speech Quality Index von Artificial Analysis mit 82,6 Punkten den ersten Platz in der Gesamtwertung. Bei der Aufgabenerfüllung erzielte das Modell 68,6 % in τ-Voice, 35,1 % im τ-Voice-banking-Test von Sierra und 97,7 % in Big Bench Audio. Gemini 3.8 Live erreichte in der Speech Agent Arena den zweiten Platz. In der EVA-Bench-Bewertung von ServiceNow verbesserten die Modelle die Pareto-Grenze bei komplexen Arbeitsabläufen, indem sie Genauigkeit und Gesprächsqualität in Einklang brachten.

Gemini 3.8 Live verarbeitet visuelle Eingaben nahezu in Echtzeit, ergänzt Gespräche dadurch um Kontext und kann während eines Gesprächs automatisch zwischen 97 unterstützten Sprachen wechseln. Das Modell kann die Unterhaltung fortsetzen, während es Tools und API-Aufrufe im Hintergrund ausführt. Mithilfe visuellen Kontexts kann es Beschäftigte bei Einarbeitungsprozessen anleiten und Schach spielen.

Gemini 3.8 Live Extended Thinking hingegen denkt und spricht gleichzeitig und erläutert bei mehrstufigen Aufgaben den Fortschritt mündlich. Es kann Rohzeichnungen und gesprochenes Feedback in funktionsfähige React-Komponenten umwandeln sowie Reservierungen, asynchrone Funktionsaufrufe, Geschäftspläne und Marketinginstrumente im Gespräch erstellen.

Das Modell ist in Docs Live, Gmail Live und Keep Live verfügbar. Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel und Vision Agents unterstützen die Entwicklung von Sprachschnittstellen mit der Gemini Live API. Google arbeitet außerdem mit Salesforce, Genspark und Lumeris zusammen. Alle erzeugten Stimmen werden mit SynthID gekennzeichnet, damit sie zur Bekämpfung von Desinformation erkannt werden können.

Warum das wichtig ist

Diese Ankündigung bietet einen Rahmen, der den Einsatz sprachbasierter KI über einfache Fragen und Antworten hinausführt und visuellen Kontext, die Nutzung von Tools und mehrstufige Arbeitsabläufe in einer einzigen Interaktion vereint. Dadurch entstehen insbesondere für Nutzer von Google Workspace, Entwickler und Unternehmen, die dialogbasierte Schnittstellen entwickeln, neue Anwendungsmöglichkeiten. Die Ergebnisse der Modelle in verschiedenen Tests zeigen, dass Google das Gleichgewicht zwischen Sprachqualität und Aufgabenerfüllung gemeinsam bewertet. Es bleibt jedoch offen, inwieweit sich diese Vergleiche im täglichen Einsatz bei Aufgaben wie Reservierungen, der Erstellung von Geschäftsplänen oder Anleitungen zur Einhaltung von Vorschriften widerspiegeln werden. Die Kennzeichnung der Stimmen mit SynthID soll dabei helfen, erzeugte Inhalte zu erkennen. Wie sich dies auf die Vertrauensentscheidungen der Nutzer auswirken wird, bleibt ebenfalls zu beobachten.

Hintergrund

Gemini ist im Archiv von FikirPilot kein neuer Name: In den vergangenen 90 Tagen haben wir 10 Meldungen veröffentlicht, in denen dieser Name vorkam; die neueste stammt vom 8. September 2026.

Quelle: Google DeepMind