首页 / 提示缓存
💾 提示缓存 是什么?
提示缓存就是AI记住了你经常说的开场白——省得每次从头再读一遍,省钱又省时间。
⚡ 一句话秒懂
提示缓存就是AI记住了你经常说的开场白——省得每次从头再读一遍,省钱又省时间。
📖 举个故事
你每天上班都和同一栋写字楼的保安打招呼:早上好!第一天,保安认真听你的每个字。半年后,你刚张嘴,保安已经点头说早啊——他缓存了你的习惯,不用再仔细听也知道你要说什么。提示缓存也是这个道理。如果你的系统提示词或文档很长(比如一份1000字的公司介绍),每次对话都重新传一遍既慢又花钱。提示缓存让AI记住这段内容,后续对话直接引用缓存。
💡 类比理解
暂未补充。
🧩 真实例子
暂未补充。
🛠️ 怎么实际使用
你做一个法律咨询AI,每次对话前都要上传一份10000字的公司法文档。没有缓存:每次请求都传这10000字,按token计费,一次提问就花不少钱。启用缓存:第一次上传后,系统缓存这份文档。后续对话只需传缓存ID,费用只有几行字的钱。在批量处理场景,比如一天处理10万条客服请求,缓存能节省90%以上的token费用。
📚 进阶原理
提示缓存(Prompt Caching / KV Cache)是优化LLM推理的技术。原理:Transformer推理时,系统提示词和早期对话的Key-Value缓存可以复用。实现形态:API层面(系统提示词预先计算并缓存)、推理框架层面(vLLM、TGI等)。OpenAI等API提供商支持Prompt Caching功能,对重复的系统提示词自动打折计价。