使用 VS Code Cache Explorer 诊断提示词缓存:定位 Cache Miss、Token 成本与延迟问题 文档教程【免费下载链接】vscode-docsPublic documentation for Visual Studio Code项目地址https://gitcode.com/gh_mirrors/vs/vscode-docs点击查看免费下载在 Visual Studio Code 的 GitHub Copilot Chat 与 Agent 工作流中语言模型提供商会复用上一次请求中未发生变化的前缀prompt prefix来降低延迟与 Token 消耗但当会话上下文被反复改动时前缀命中率会下降导致输入 Token 用量与延迟异常升高。本文以 cache-explorer.md 为骨架系统讲解如何通过Agent Debug Logs 面板中的 Cache Explorer 视图对同一会话内相邻两次模型请求做逐组件对比定位首次分歧点first divergence并基于证据判断缓存未命中cache miss是否由你可控的配置变更引起。读完本文你将掌握缓存诊断的正确时机、比较结果的解读方法、一次缓存未命中的完整调查流程以及保持请求上下文稳定的最佳实践从而在不牺牲响应质量的前提下压降 Token 成本与延迟。理解提示词缓存Prompt Caching机制提示词缓存是依赖模型与提供商的能力并非所有模型或服务都暴露缓存指标。当提供商支持缓存时它会尝试复用与已缓存内容匹配的请求开头部分——也就是请求的公共前缀。正因为缓存命中的核心是前缀一致一个出现在请求靠前位置的变化例如系统指令被编辑、工具定义被增减会显著压缩可复用的前缀长度直接表现为缓存命中率下降。Cache Explorer 正是为此设计的它展示同一会话内两次相邻模型请求之间的差异diff并定位二者的首个分歧点。这个差异可以解释会话中某个缓存指标的成因但需要强调的是缓存指标只能反映请求结构层面的差异并不能证明模型提供商在推理时实际如何处理或计费这次请求。[!IMPORTANT] 不要为了提升缓存命中率而删除必要的指令、工具或上下文。响应质量与任务正确性永远优先于缓存指标。何时使用 Cache Explorer诊断时机与前置条件Cache Explorer 不是通用的聊天调试入口它有一个明确的适用场景当Agent Debug Logs 的 Summary 视图报告某次请求的缓存复用率偏低同时该请求又伴随异常的耗时或输入 Token 用量时才值得打开 Cache Explorer 做深入比较。在 chat-debug-view.md 中各诊断视图的分工是互补的要回答的问题使用的工具会话里发生了什么、顺序如何Agent Debug Logs 面板中的Logs 视图会话耗时、Token 用量、是否有错误Summary 视图Agent 与子代理如何交互Agent Flow Chart 视图实际发送给模型的提示词、上下文与工具Chat Debug 视图请求之间的改动是否降低了缓存复用Cache Explorer 视图也就是说如果会话遇到的是通用性 Agent 故障、上下文缺失或工具调用错误应先从 调试聊天交互 入手而不是直接使用 Cache Explorer。在开始比较之前请确认满足以下前置条件否则比较结果没有意义会话至少包含两次模型请求——没有相邻请求就没有可比对象。先打开 Summary 视图确认某次请求的缓存复用率确实偏低并且该请求同时伴有异常的耗时或输入 Token 用量。只在同一会话内比较请求验证某个改动的影响时尽量保持模型与任务类型可比。一个常见的情况是Summary 视图根本没有报告缓存信息。这说明当前选用的模型或提供商可能不暴露缓存指标此时应改用Logs 视图去调查请求耗时、错误与工具调用而不是强行依赖缓存数据。打开 Cache Explorer 的步骤打开 Cache Explorer 需要经过 Agent Debug Logs 面板操作路径如下在 Copilot Chat 视图中选择省略号...菜单然后选择Show Agent Debug Logs打开 Agent Debug Logs 面板。在面板顶部的面包屑中选择会话描述打开该会话的Summary 视图。在 Summary 视图中选择Cache Explorer进入缓存比较视图。Agent Debug Logs 面板也可以通过命令面板执行Developer: Open Agent Debug Logs打开面板中会列出当前会话与历史会话持久化的日志保存在本地。解读比较结果界面组成与关键字段Cache Explorer 视图分为侧边面板与主区域两部分侧边面板按用户请求user request对模型轮次model turns分组每个轮次可以展示缓存命中百分比、耗时、模型名称与时间戳。选中某个轮次后主区域会将该请求与它的前一个请求进行并排比较。主区域包含三个核心区块Cache performance缓存性能报告该请求的缓存百分比以及被复用的输入 Token 数量。Prompt signature提示词签名对请求组成部分的概要例如系统指令、工具定义、消息。首个分歧点标注出相邻两次请求在何处停止匹配——这是整个诊断中最关键的信息。Components组件针对各个请求组件提供可展开的文本差异用于逐段查看具体改了什么。需要注意一个边界情况如果某个轮次没有前一个模型请求例如它就是会话的第一轮则不存在相邻请求Cache Explorer 无比较对象。调查一次缓存未命中Cache Miss的完整流程当某个轮次的缓存复用率偏低且伴随异常耗时或输入 Token 用量时按下述七步流程进行调查选定目标轮次选中缓存复用率低、且耗时或输入 Token 用量异常的轮次。定位首次分歧在 Prompt signature 中找到首个分歧点。展开对应组件展开该组件确认具体是什么发生了变化。判断变更性质判断这个改动是否必要、是否在你的掌控范围内是否由你的配置引起。做一处有依据的调整只调整一处避免同时改动多个变量导致无法归因。复现对比用调整后的配置开启一个新会话重复执行相同的两次请求序列。综合评估后决定去留对比第二次请求的缓存指标、耗时、输入 Token 用量与响应质量只有整体结果确实改善才保留这次调整。原文档给出了一个非常典型的场景假设首个分歧点出现在工具定义tool definitions中原因是你在两次请求之间启用了某个 MCP 服务器。此时处理方式取决于必要性——如果该服务器是任务所必需的就保留它并接受较低的复用率如果不是必需的就在开始新会话之前选好工具再重复相同的两次请求序列。最后必须牢记diff 中的一处变化只是关于请求结构的证据并不能证明缓存问题导致了全部可观察到的延迟。将比较结果当作诊断线索而不是结论本身。保持请求上下文稳定减少不必要的跨轮次改动缓存命中率低往往不是单一原因而是多个微小改动叠加的结果。以下实践可以显著减少相邻请求之间的非必要差异在开始前选定会话选项尽可能在第一次请求之前就选好模型model、推理努力程度reasoning effort、上下文大小context size与所需工具避免会话中途变更。保持共享指令稳定在比较期间避免编辑指令文件instructions files或自定义 Agent 定义。如何系统性地维护这些稳定上下文可参考 上下文工程指南。只附加相关的上下文反复添加或替换附件会改变请求结构尽量附加任务真正需要的、聚焦的上下文。隔离独立研究当独立的调研任务放在父会话中会污染主上下文时改用 子代理subagent 在独立上下文中完成只把结论带回主会话。有意地重置长会话当累积的历史对当前任务不再有帮助时开启新会话或使用/compact压缩历史而不是放任无关内容继续膨胀前缀。同时要意识到部分请求组件是由 VS Code 本身、扩展或模型提供商装配的并不在你的直接控制之下。如果首个分歧点出现在你的配置范围之外应把比较结果当作诊断证据使用而不是强行围绕它改写提示词——那样反而可能损害任务质量。与优化闭环的衔接把缓存指标用起来Cache Explorer 提供的数据并不是孤立存在的。在 优化 AI 用量指南 中提示词缓存的价值被明确概括为模型提供商复用与先前请求匹配的前缀从而降低延迟与 Token 成本。而 Summary 视图负责展示会话级聚合 Token 用量与总耗时Cache Explorer 视图负责展示缓存命中率与复用 Token 数量——二者合在一起构成了一个可量化的优化循环运行一个有代表性的任务记录其质量、可靠性、积分/Token、耗时、工具调用与错误。只改变一个变量模型、可用工具、委派策略或上下文来源。重复同一任务并对比结果。保留达到质量阈值且成本最低的配置。Cache Explorer 的比较相邻请求 定位首次分歧能力正好为这个循环的第 2、3 步提供了结构层面的证据它能告诉你变的是哪个组件、什么时候开始变的从而避免凭感觉猜测。相关资源调试聊天交互Agent Debug Logs、Summary、Logs、Agent Flow Chart 与 Chat Debug 视图优化 AI 用量Token 与积分成本控制上下文工程指南维护稳定的项目级指令与上下文使用子代理隔离独立调研任务赞分享文档教程【免费下载链接】vscode-docsPublic documentation for Visual Studio Code项目地址https://gitcode.com/gh_mirrors/vs/vscode-docs点击查看免费下载相关推荐国家中小学智慧教育平台电子课本下载完整指南三步把课本存成本地 PDF 教材国家中小学智慧教育平台电子课本下载完整指南三步把课本存成本地 PDF 教材 tchMaterial parser 是一款免费开源的电子课本下载工具把智慧教育网页爬虫教育Operit Token 统计缓存率展示与主题色标准化用 Cache Rate 替换 Cache-Write 的实战改造Operit Token 统计缓存率展示与主题色标准化用 Cache Rate 替换 Cache Write 的实战改造 本篇技术指南基于 Operit 开源AI Agent人工智能大模型AI 应用工具调用本地部署MCP ClientsAgent 记忆GUI 自动化OpenHuman 提示词缓存命中审计指南用 pnpm debug harness-cache-audit 量化多轮 Agent 会话的 token 缓存收益OpenHuman 提示词缓存命中审计指南用 pnpm debug harness cache audit 量化多轮 Agent 会话的 token 缓存收益人工智能AI 应用本地部署AI Agent交互助手深度研究上一篇CAS 委托认证接入 Google 登录OAuth2 与 OpenID Connect 双路径配置及源码解析下一篇如何永久保存微信聊天记录留痕工具的完整使用指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考