Vai al contenuto
Italiano
Contenuto FikirPilot

Presentati Gemini 3.8 Live e 3.8 Live Extended Thinking

Aggiornato: 15/09/2026 · 3 min di lettura · 491 parole

Pubblicato: · Notizia ricevuta: · Tempo di elaborazione: 2 h 47 min

Fonte verificata:

Presentati Gemini 3.8 Live e 3.8 Live Extended Thinking
Telefono con schermo digitale appoggiato sul tavolo

Google ha presentato i modelli Gemini 3.8 Live e Gemini 3.8 Live Extended Thinking, progettati per rendere le interazioni vocali più naturali, fluide e intelligenti. I modelli offrono funzionalità di ragionamento complesso, contesto visivo in tempo reale ed esecuzione di attività in background senza interrompere la conversazione. Da oggi gli utenti possono accedere ai modelli tramite Gemini API, Google Workspace e l’applicazione Gemini.

Gemini 3.8 Live Extended Thinking si è classificato al primo posto nella graduatoria generale dello Speech to Speech Quality Index di Artificial Analysis, con 82,6 punti. Nell’ambito del completamento delle attività, il modello ha ottenuto il 68,6% in τ-Voice, il 35,1% nel test τ-Voice-banking di Sierra e il 97,7% in Big Bench Audio. Gemini 3.8 Live si è classificato al secondo posto nella Speech Agent Arena. Nella valutazione EVA-Bench di ServiceNow, i modelli hanno ampliato la frontiera di Pareto nei flussi di lavoro complessi, bilanciando accuratezza e qualità della conversazione.

Gemini 3.8 Live elabora gli input visivi quasi in tempo reale, aggiungendo contesto alle conversazioni, e può passare automaticamente tra le 97 lingue supportate durante il dialogo. Può proseguire la conversazione mentre esegue in background strumenti e chiamate API. Grazie al contesto visivo, può guidare i dipendenti nei processi di inserimento e giocare a scacchi.

Gemini 3.8 Live Extended Thinking, invece, pensa e parla contemporaneamente, comunicando a voce i progressi nelle attività articolate in più fasi. Può trasformare schizzi grezzi e feedback vocali in componenti React funzionali; inoltre, tramite la conversazione, può predisporre prenotazioni, chiamate di funzioni asincrone, piani di lavoro e strumenti di marketing.

Il modello è disponibile in Docs Live, Gmail Live e Keep Live. Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents supportano lo sviluppo di interfacce vocali con Gemini Live API. Google collabora inoltre con Salesforce, Genspark e Lumeris. Tutte le voci generate vengono contrassegnate con SynthID affinché possano essere rilevate in caso di disinformazione.

Perché è importante

Questo annuncio propone un quadro che porta l’uso dell’intelligenza artificiale vocale oltre il semplice livello di domanda e risposta, combinando nello stesso tipo di interazione il contesto visivo, l’uso di strumenti e i flussi di lavoro articolati in più fasi. Crea quindi nuove possibilità applicative, in particolare per chi utilizza Google Workspace, per gli sviluppatori e per le aziende che realizzano interfacce basate sulla conversazione. I risultati ottenuti dai modelli nei diversi test mostrano che Google valuta insieme l’equilibrio tra qualità della voce e completamento delle attività; resta però da capire in che misura questi confronti troveranno riscontro nell’uso quotidiano per attività come prenotazioni, piani di lavoro o indicazioni sulla conformità. Mentre il contrassegno delle voci con SynthID mira ad aiutare a distinguere i contenuti generati, anche il modo in cui ciò influirà sulle valutazioni di affidabilità degli utenti resta un aspetto da monitorare.

Contesto

Gemini non è un nome nuovo nell’archivio di FikirPilot: negli ultimi 90 giorni abbiamo pubblicato 10 notizie in cui compare questo nome; la più recente è datata 8 settembre 2026.

Fonte: Google DeepMind