首页 / 提示缓存

💾 提示缓存 是什么?

提示缓存就是AI记住了你经常说的开场白——省得每次从头再读一遍,省钱又省时间。

Prompt与LLM交互

⚡ 一句话秒懂

提示缓存就是AI记住了你经常说的开场白——省得每次从头再读一遍,省钱又省时间。

📖 举个故事

你每天上班都和同一栋写字楼的保安打招呼:早上好!第一天,保安认真听你的每个字。半年后,你刚张嘴,保安已经点头说早啊——他缓存了你的习惯,不用再仔细听也知道你要说什么。提示缓存也是这个道理。如果你的系统提示词或文档很长(比如一份1000字的公司介绍),每次对话都重新传一遍既慢又花钱。提示缓存让AI记住这段内容,后续对话直接引用缓存。

💡 类比理解

暂未补充。

🧩 真实例子

暂未补充。

🛠️ 怎么实际使用

你做一个法律咨询AI,每次对话前都要上传一份10000字的公司法文档。没有缓存:每次请求都传这10000字,按token计费,一次提问就花不少钱。启用缓存:第一次上传后,系统缓存这份文档。后续对话只需传缓存ID,费用只有几行字的钱。在批量处理场景,比如一天处理10万条客服请求,缓存能节省90%以上的token费用。

📚 进阶原理

提示缓存(Prompt Caching / KV Cache)是优化LLM推理的技术。原理:Transformer推理时,系统提示词和早期对话的Key-Value缓存可以复用。实现形态:API层面(系统提示词预先计算并缓存)、推理框架层面(vLLM、TGI等)。OpenAI等API提供商支持Prompt Caching功能,对重复的系统提示词自动打折计价。

继续学习相关术语