#提示缓存

按标签聚合查看文章内容。

最大化利用Claude Code会话的价值AI资讯

最大化利用Claude Code会话的价值

输入和输出令牌 一次请求在GPU上分两个阶段处理,且两阶段的成本不同。 首先,在预填充阶段,模型会读取你的请求和上下文:系统提示、你的CLAUDE.md文件、你的消息,以及自会话开始以来添加的所有内容(Claude读取的文件和它执行命令的输出)。这些都是你的输入令牌。 然后,在解码阶段,模型生成输出令牌:它的思考过程、调用的工具以及你看到的文本。输出是逐个令牌生成的;比如200个令牌的回复就是模型

构建Claude Code的经验:提示缓存至关重要AI资讯

构建Claude Code的经验:提示缓存至关重要

工程领域常说“缓存主宰一切”,这一原则同样适用于智能代理。 像Claude Code这样需要长时间运行的智能代理产品,得益于提示缓存(prompt caching),它让我们能够重复利用之前交互的计算结果,大幅降低延迟和成本。 在Claude Code中,我们的整个系统架构都围绕提示缓存设计。高缓存命中率不仅降低成本,还能让我们为订阅用户提供更宽松的调用限制,因此我们会监控缓存命中率,若过低则触发