Vai al contenuto
Italiano
Contenuto FikirPilot

Create esperienze vocali più naturali nell'API con GPT-Live-1

Aggiornato: 13/09/2026 · 3 min di lettura · 533 parole

Pubblicato: · Notizia ricevuta: · Tempo di elaborazione: 65 h 14 min

Create esperienze vocali più naturali nell'API con GPT-Live-1
Microfono professionale appoggiato su un tavolo

GPT‑Live‑1 porta nell’API conversazioni vocali naturali e bidirezionali. Il modello può ascoltare e parlare contemporaneamente; può delegare attività ai modelli e agli strumenti a cui è abbinato per un ragionamento più approfondito e per le azioni. Gli sviluppatori possono orientare l’esperienza vocale in base ai propri utenti, flussi di lavoro e obiettivi.

La capacità del modello di gestire le interruzioni è stata valutata positivamente da Speak nelle prime valutazioni. GPT‑Live‑1 ha ridotto le interruzioni di quasi l’80% rispetto ai precedenti sistemi sequenziali, dando agli studenti più tempo per pensare prima della risposta dell’insegnante di lingue. A differenza degli agenti vocali tradizionali, che dividono la conversazione nelle fasi di voce-testo, ragionamento e testo-voce, GPT‑Live‑1 unifica ascolto e conversazione in un unico modello. Può gestire istantaneamente la risposta, le conferme e le interruzioni, continuando in background le elaborazioni più approfondite.

Gli sviluppatori possono scegliere modelli, strumenti e infrastruttura degli agenti; Luna può essere utilizzato per la pianificazione ad alto volume o gli aggiornamenti sugli ordini, mentre Astra può essere impiegato per i problemi complessi dei clienti. In questo modo, velocità, costi e livello di ragionamento possono essere adattati all’attività. GPT‑Live‑1 fornisce trascrizioni ASR e il testo delle risposte; supporta le espressioni alfanumeriche e la definizione delle priorità delle parole chiave. Sebbene non sia un modello sequenziale, include anche il rilevamento dei turni di parola.

Nelle valutazioni, GPT‑Live‑1 ha aumentato di 30 punti le prestazioni nel Full Duplex Bench rispetto a GPT‑Realtime‑2.1. Con GPT-6 Astra si è classificato al primo posto in Tau3 nel ragionamento di livello intermedio. Il modello offre una scelta più ampia di voci in diversi accenti, dialetti e lingue. Oggi è disponibile nell’API al prezzo di $0,05 al minuto per il livello vocale del frontend. Può essere integrato con Codex e OpenAI Presence; per accedere alle voci personalizzate è necessario contattare il team commerciale.

Perché è importante

Questo approccio riguarda in particolare gli scenari educativi e di assistenza clienti, in cui l’interazione viene interrotta frequentemente, poiché consente di gestire il flusso della conversazione nelle applicazioni vocali senza suddividerlo in fasi separate di riconoscimento, elaborazione e sintesi vocale. La possibilità di gestire l’ascolto, la risposta e le attività in background all’interno della stessa struttura permette agli sviluppatori di creare componenti diversi in base alle esigenze di velocità, costo e ragionamento, invece di un agente unico. I risultati delle prime valutazioni mostrano che i confronti delle prestazioni misurano non solo la capacità tecnica, ma anche la naturalezza della conversazione e i tempi di attesa. Il fatto che l’API fornisca la trascrizione e il testo della risposta facilita il collegamento delle interazioni vocali ai flussi di lavoro esistenti. Tuttavia, il costo totale della tariffa al minuto nell’uso ad alto volume e il fatto che l’accesso alle voci personalizzate dipenda dal processo commerciale restano aspetti aperti che i team intenzionati a passare all’implementazione devono valutare separatamente.

Contesto

GPT non è un nome nuovo nell’archivio di FikirPilot: negli ultimi 90 giorni abbiamo pubblicato 2 notizie in cui compare questo nome; la più recente è datata 13 settembre 2026.

Termine: agente

Un agente di intelligenza artificiale è un software che, invece di generare una sola risposta, richiama strumenti ed esegue attività in più fasi per raggiungere un obiettivo.

Fonte: OpenAI