Share GPT-6 旨在让持久代理连续数小时处理重构代码库、准备经过研究的文档和演示文稿等复杂任务。在这些代理连续发出的 API 请求中,重复的指令、工具定义和上下文会被缓存,从而复用计算资源;响应时间随之缩短,开发者在缓存输入令牌上可获得最高 90% 的折扣。GPT-6 系列引入了默认提供更高命中率的新缓存系统。合适的共同前缀在 30 分钟窗口内被重新使用时,即可享受折扣。
- Prompt Caching Dashboard 会显示从缓存提供的输入量及一段时间内的命中率;还可用于比较已缓存和未缓存的令牌。
- Prompt caching diagnostics tool 会在缓存未命中时,对比模型、工具、设置或输入的变化。示例中给出的原因为“tools_changed”,可比较的可重用令牌数为 5629,未命中的令牌数为 5629。
- 通过显式的缓存断点,可以选择要保存哪些指令前缀。
- 在 GPT-6 模型中,可以在不同响应之间调整 reasoning effort,而不会破坏缓存。
- 可以保持工具定义、架构和排序不变;也可以使用 allowed_tools 或 tool_choice。
- 可以将新的 developer 消息添加到上下文末尾,以使旧指令失效。
- Prewarming 会在用户请求之前准备共享上下文。Codex 则可帮助检查代码并应用改进。
为什么重要
这项调整有助于管理长期运行的代理在每个步骤中重复处理相同指令、工具信息和上下文所产生的成本与延迟。尤其是对于在代码库上运行、生成文档或执行多个 API 调用的应用,其开发者将能够不仅根据模型响应,还根据缓存的使用效率来评估性能。Dashboard 和诊断工具能够显示缓存未命中是否源于工具、设置或输入的变化,从而使调试过程更加具体。通过显式缓存断点以及调整推理水平,可以在代理行为与缓存使用之间建立更加可控的关系。不过,收益的范围仍取决于整个工作流程中共同前缀和工具配置能够在多大程度上保持不变这一问题。
背景
GPT 并不是 FikirPilot 档案中的新名字:在最近 90 天内,我们发布了 4 篇提到这一名称的新闻;最新一篇的日期是 2026 年 9 月 29 日。
术语:代理
人工智能代理不是只生成单个响应,而是通过调用工具来执行多步骤工作、以实现目标的软件。