让重复的 LLM 请求免费:LiteLLM 缓存的接入与选型 📅 发布时间:2026/8/30 20:42:23 👁 浏览次数: 让重复的 LLM 请求免费LiteLLM 缓存的接入与选型【免费下载链接】litellmThe fastest, litest AI Gateway. Rust core with Python SDK. Call 100 LLM APIs in OpenAI (or native) format with cost tracking, guardrails, load balancing, and logging [Bedrock, Azure, OpenAI, Anthropic, OpenAI, VertexAI, vLLM, Nvidia NIM]项目地址: https://gitcode.com/GitHub_Trending/li/litellm客服系统里怎么开发票一天被问三千次RAG 里同一段文档反复检索、反复生成同一段答案。每多一次就多一次计费多一次网络往返成本与延迟同时上涨。LiteLLM 缓存把这类重复请求拦在模型供应商之前相同参数或语义相近的请求直接返回已存好的响应。后端选型内存、Redis 缓存配置与语义缓存后端适用场景代价命中特征内存local原型验证、单实例部署进程重启即丢多实例不共享参数逐字相同才命中零额外依赖Redisredis生产多实例、需要跨进程共享多一套实例要维护逐字匹配TTL 可控支持批量写语义缓存redis-semantic问法相近、措辞不同的重复问题每次查询要调 embedding 模型且必须显式给similarity_threshold按向量距离命中近似请求阈值过松会误命中S3、GCS、Azure Blob 等云后端也能挂进来定位是长期冷存储查询延迟比内存和 Redis 高一个量级。最小接入四行代码启用 LiteLLM 缓存import litellm from litellm.caching import Cache litellm.cache Cache(typeredis, hostlocalhost, port6379, default_in_redis_ttl3600) litellm.completion(modelgpt-4o-mini, messages[{role: user, content: 你们支持哪些退款方式}])命中时请求在input_callback里就被截住响应按存好的 JSON 直接返回模型供应商没有收到这次调用token 费用为 0开了流式的话命中结果按 5 字符一块回放。三个高频坑缓存不一致、TTL 与语义缓存阈值缓存结果不一致缓存键比你想的敏感同一个问题A 服务拿到答案甲B 服务拿到答案乙。原因是缓存键由模型名加全部参数拼出后取 SHA-256temperature差 0.1、system prompt 多一个空格、namespace 不同都会落到不同的键上。处理办法让同类请求固定参数和模型名确需跨模型共享时用caching_groups。TTL 设置不当该在的不在该走的不走本地内存缓存默认 TTL 是 600 秒而 Redis 侧不设default_in_redis_ttl时条目永不过期。前者让十分钟后的重复请求重新计费后者让过期知识一直占着内存。处理办法按答案的更新节奏设定 TTL热点问答短周期稳定知识长周期。语义缓存阈值过松答非所问用户问退款政策返回的是发票问题的回答。语义缓存把 prompt 过 embedding 再按余弦相似度判命中阈值定得低不同问题会落到同一条向量附近。处理办法阈值从 0.95 起步结合日志里的semantic-similarity值逐步收紧事实型问答宁可 miss 也不返回近似答案。开还是关LLM 成本优化前的判断标准该开重复问题占比高、答案可容忍分钟到天级的过期、同一请求会被多个实例命中。别开请求几乎互不重复、答案依赖实时数据、强依赖流式长输出、单条响应超过 1MB内存后端会直接跳过不存。上线后只看一个数命中率。连续两周低于 5%就把缓存关掉省下的是一笔持续的维护成本。【免费下载链接】litellmThe fastest, litest AI Gateway. Rust core with Python SDK. Call 100 LLM APIs in OpenAI (or native) format with cost tracking, guardrails, load balancing, and logging [Bedrock, Azure, OpenAI, Anthropic, OpenAI, VertexAI, vLLM, Nvidia NIM]项目地址: https://gitcode.com/GitHub_Trending/li/litellm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考