Share GPT-6 zielt darauf ab, dass dauerhafte Agenten stundenlang an komplexen Aufgaben wie der Umstrukturierung von Codebasen sowie der Erstellung recherchierter Dokumente und Präsentationen arbeiten. Bei den aufeinanderfolgenden API-Anfragen dieser Agenten werden wiederholte Anweisungen, Tool-Definitionen und Kontext zwischengespeichert, sodass Berechnungen wiederverwendet werden; die Antwortzeiten verkürzen sich, und Entwickler erhalten bei zwischengespeicherten Eingabetokens Rabatte von bis zu 90 %. Die GPT-6-Familie führt ein neues Caching-System ein, das standardmäßig eine höhere Trefferquote bietet. Geeignete gemeinsame Präfixe werden rabattiert, wenn sie innerhalb eines 30-minütigen Zeitfensters wiederverwendet werden.
- Das Prompt Caching Dashboard zeigt die aus dem Cache bereitgestellte Eingabemenge und die Trefferquoten im Zeitverlauf an; es ermöglicht den Vergleich zwischengespeicherter und nicht zwischengespeicherter Tokens.
- Das Prompt caching diagnostics tool vergleicht bei Cache-Misses Änderungen an Modellen, Tools, Einstellungen oder Eingaben. Im Beispiel werden als Grund „tools_changed“, die Anzahl der vergleichbaren wiederverwendbaren Tokens mit 5629 und die Anzahl der verfehlten Tokens mit 5629 angegeben.
- Mit expliziten Cache-Schnittpunkten lässt sich auswählen, welche Anweisungspräfixe gespeichert werden.
- Bei GPT-6-Modellen kann der reasoning effort zwischen den Antworten geändert werden, ohne den Cache zu beeinträchtigen.
- Tool-Definitionen, Schemata und Reihenfolge können konstant gehalten werden; allowed_tools oder tool_choice können verwendet werden.
- Neue developer-Nachrichten können am Ende des Kontexts hinzugefügt werden, um alte Anweisungen außer Kraft zu setzen.
- Prewarming bereitet den gemeinsamen Kontext vor der Benutzeranfrage vor. Codex hilft dabei, den Code zu überprüfen und Verbesserungen umzusetzen.
Warum das wichtig ist
Diese Änderung erleichtert es, die Kosten und Verzögerungen zu bewältigen, die dadurch entstehen, dass langlebige Agenten bei jedem Schritt dieselben Anweisungen, Tool-Informationen und denselben Kontext erneut verarbeiten. Insbesondere Entwickler von Anwendungen, die auf Codebasen arbeiten, Dokumente erstellen oder mehrere API-Aufrufe durchführen, können die Leistung nicht nur anhand der Modellantwort, sondern auch danach bewerten, wie effektiv der Cache genutzt wird. Das Dashboard und das Diagnosetool machen den Debugging-Prozess greifbarer, indem sie sichtbar machen, ob ein Cache-Miss durch Änderungen an Tools, Einstellungen oder Eingaben verursacht wurde. Die Möglichkeit, explizite Breakpoints zu setzen und die Reasoning-Stufe zu ändern, schafft eine kontrolliertere Beziehung zwischen Agentenverhalten und Cache-Nutzung. Der Umfang des Nutzens hängt jedoch weiterhin davon ab, in welchem Maß gemeinsame Präfixe und die Tool-Konfiguration über den gesamten Workflow hinweg beibehalten werden können.
Hintergrund
GPT ist im Archiv von FikirPilot kein neuer Name: In den letzten 90 Tagen haben wir 4 Nachrichten veröffentlicht, in denen dieser Name vorkommt; die jüngste ist vom 29. September 2026.
Begriff: Agent
Ein KI-Agent ist eine Software, die nicht nur eine einzelne Antwort erzeugt, sondern Tools aufruft und mehrstufige Aufgaben ausführt, um ein Ziel zu erreichen.