OpenAI 于2026年9月22日更新了 GPT-6 的提示词缓存能力。公司称,GPT-6 对在30分钟窗口内重复使用的合格共享前缀提供缓存折扣。这类复用可见于持续运行的智能体反复携带系统指令、工具定义和既有上下文的场景。官方表示,缓存输入 Token 的折扣最高可达90%。
此次更新增加了查看缓存命中情况的仪表盘,以及定位缓存未命中原因的诊断工具。开发者可据此比较相邻请求,检查模型、工具、设置或输入变化是否影响上下文复用。这些工具不改变模型输出能力,主要用于观察和调整调用方式。
OpenAI 还引入显式缓存断点,允许应用指定可复用前缀的边界。页面同时说明,开发者可通过配置更新调整 GPT-6 的推理强度,并提供缓存预热控制。
上述能力面向 API 集成和长会话工作流。缓存折扣是否适用,仍取决于请求是否复用了合格共享前缀,以及复用是否发生在30分钟窗口内。
缓存控制把优化重心移向请求编排
对模型服务商而言,缓存并不等同于下调模型标价,而是为重复使用的合格共享前缀提供不同于常规输入的计费处理。对于反复携带规则、知识材料和工具说明的企业智能体,较稳定的请求编排可能有助于控制单位调用成本;但上下文频繁改写、工具定义变化较多,或请求之间共享内容有限时,实际可获得的折扣空间会收窄。应用软件厂商因此需要将提示词结构、工具配置和会话状态管理纳入工程优化,而不能只按模型的名义 Token 单价估算成本。基础设施侧则需同时观察缓存命中变化与业务调用规模,不能据此直接推断整体资源需求的升降。
| 涉及行业 | 行业影响分析 | 简要理由 |
|---|---|---|
| 应用软件 | 利好 | 对重复共享上下文较多的 API 工作流,缓存复用和诊断工具可帮助控制单位调用成本;长会话智能体与企业应用可通过稳定提示词和工具结构提高复用机会,实际效果取决于工作流。 |
| 互联网服务与基础设施 | 中性 | 缓存会改变重复上下文的处理方式,实际资源消耗仍受调用规模和缓存命中情况共同影响。 |
新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。
