Share GPT-6 vise à permettre aux agents persistants de travailler pendant des heures sur des tâches complexes, comme la réorganisation de bases de code, la préparation de documents de recherche et de présentations. Lors des requêtes API successives effectuées par ces agents, les instructions répétées, les définitions d’outils et le contexte sont mis en cache afin de réutiliser les calculs ; les temps de réponse sont réduits et les développeurs bénéficient d’une remise pouvant atteindre 90 % sur les jetons d’entrée mis en cache. La famille GPT-6 introduit un nouveau système de mise en cache qui offre par défaut un taux de réussite plus élevé. Les préfixes communs appropriés bénéficient d’une remise lorsqu’ils sont réutilisés dans une fenêtre de 30 minutes.
- Prompt Caching Dashboard affiche la quantité d’entrées servies depuis le cache et les taux de réussite au fil du temps ; il permet de comparer les jetons mis en cache et ceux qui ne le sont pas.
- Prompt caching diagnostics tool compare, lors des échecs du cache, les modifications apportées au modèle, aux outils, aux paramètres ou aux entrées. Dans l’exemple, la raison « tools_changed », le nombre de jetons réutilisables comparables, qui s’élève à 5629, et le nombre de jetons non mis en cache, qui s’élève également à 5629, sont indiqués.
- Des points d’interruption explicites du cache permettent de sélectionner les préfixes d’instructions à conserver.
- Dans les modèles GPT-6, le reasoning effort peut être modifié d’une réponse à l’autre sans perturber le cache.
- Les définitions d’outils, les schémas et l’ordre peuvent être maintenus constants ; allowed_tools ou tool_choice peuvent être utilisés.
- De nouveaux messages developer peuvent être ajoutés à la fin du contexte afin d’invalider les anciennes instructions.
- Le prewarming prépare le contexte commun avant la requête de l’utilisateur. Codex aide quant à lui à examiner le code et à appliquer les améliorations.
Pourquoi c’est important
Cette modification facilite la gestion des coûts et de la latence liés au retraitement, à chaque étape, des mêmes instructions, informations sur les outils et éléments de contexte par les agents de longue durée. Les développeurs d’applications qui travaillent notamment sur des bases de code, produisent des documents ou effectuent plusieurs appels API pourront évaluer les performances non seulement à l’aune de la réponse du modèle, mais aussi de l’efficacité d’utilisation du cache. Le Dashboard et l’outil de diagnostic concrétisent le processus de débogage en indiquant si un défaut de cache est dû à des changements apportés aux outils, aux paramètres ou aux entrées. La possibilité de définir des points d’arrêt explicites et de modifier le niveau de raisonnement permet d’établir une relation plus maîtrisée entre le comportement de l’agent et l’utilisation du cache. Toutefois, l’ampleur du gain dépend toujours de la mesure dans laquelle les préfixes communs et la configuration des outils peuvent être conservés tout au long du flux de travail.
Contexte
GPT n’est pas un nouveau nom dans les archives de FikirPilot : au cours des 90 derniers jours, nous avons publié 4 articles dans lesquels ce nom est mentionné ; le plus récent date du 29 septembre 2026.
Terme : agent
Un agent d’intelligence artificielle est un logiciel qui, au lieu de produire une seule réponse, appelle des outils et exécute une tâche en plusieurs étapes afin d’atteindre un objectif.