Vai al contenuto
Italiano
Contenuto FikirPilot

Una migliore memorizzazione nella cache dei prompt per GPT-6

Aggiornato: 03/10/2026 · 3 min di lettura · 499 parole

Pubblicato: · Notizia ricevuta: · Tempo di elaborazione: 247 h

Una migliore memorizzazione nella cache dei prompt per GPT-6
Racks di server con luci blu

Share GPT-6 mira a consentire agli agenti persistenti di lavorare per ore su attività complesse, come riorganizzare basi di codice e preparare documenti e presentazioni basati su ricerche. Nelle richieste API consecutive effettuate da questi agenti, le istruzioni ripetute, le definizioni degli strumenti e il contesto vengono memorizzati nella cache, consentendo di riutilizzare il calcolo; i tempi di risposta si riducono e gli sviluppatori ottengono sconti fino al 90% sui token di input memorizzati nella cache. La famiglia GPT-6 introduce un nuovo sistema di caching che offre, per impostazione predefinita, un tasso di riscontri positivi più elevato. I prefissi comuni idonei rientrano nell’ambito dello sconto quando vengono riutilizzati entro una finestra di 30 minuti.

  • Prompt Caching Dashboard mostra la quantità di input fornita dalla cache e i tassi di riscontro positivo nel tempo; consente di confrontare i token memorizzati nella cache con quelli non memorizzati.
  • Prompt caching diagnostics tool confronta i cambiamenti apportati al modello, agli strumenti, alle impostazioni o agli input in caso di cache miss. Nell’esempio, il motivo è indicato come “tools_changed”, mentre il numero di token riutilizzabili comparabili è 5629 e il numero di token persi è 5629.
  • Con punti di interruzione espliciti della cache è possibile selezionare quali prefissi di istruzioni conservare.
  • Nei modelli GPT-6, reasoning effort può essere modificato tra una risposta e l’altra senza invalidare la cache.
  • Le definizioni degli strumenti, gli schemi e l’ordine possono essere mantenuti fissi; è possibile utilizzare allowed_tools o tool_choice.
  • Nuovi messaggi dello sviluppatore possono essere aggiunti alla fine del contesto per invalidare le istruzioni precedenti.
  • Il prewarming prepara il contesto comune prima della richiesta dell’utente. Codex, invece, aiuta a esaminare il codice e ad applicare i miglioramenti.

Perché è importante

Questa modifica facilita la gestione dei costi e dei ritardi derivanti dal fatto che gli agenti di lunga durata rielaborano a ogni passaggio le stesse istruzioni, le informazioni sugli strumenti e il contesto. In particolare, gli sviluppatori di applicazioni che lavorano su basi di codice, producono documenti o effettuano più chiamate API potranno valutare le prestazioni non solo in base alla risposta del modello, ma anche all’efficacia dell’utilizzo della cache. La dashboard e lo strumento diagnostico rendono più concreto il processo di debugging, mostrando se un cache miss è dovuto a modifiche agli strumenti, alle impostazioni o agli input. La possibilità di definire punti di interruzione espliciti e di modificare il livello di reasoning crea un rapporto più controllato tra il comportamento dell’agente e l’utilizzo della cache. Tuttavia, l’entità del vantaggio continua a dipendere dalla misura in cui i prefissi condivisi e la configurazione degli strumenti possono essere mantenuti invariati lungo il flusso di lavoro.

Contesto

GPT non è un nome nuovo nell’archivio di FikirPilot: negli ultimi 90 giorni abbiamo pubblicato 4 notizie in cui compare questo nome; la più recente è del 29 settembre 2026.

Termine: agente

Un agente di intelligenza artificiale è un software che, invece di generare una singola risposta, effettua chiamate agli strumenti e svolge attività in più passaggi per raggiungere un obiettivo.

Fonte: OpenAI