Redis推出全新托管语义缓存服务 LangCache,目前已在 Redis Cloud 开放公开预览。
这项服务不是按文本是否完全一致来判断缓存命中,而是通过语义匹配识别相似提示。命中缓存后,应用可以跳过对大语言模型的调用,从而降低 API 成本,并缩短响应时间。Redis称,该服务最高可节省 90% 的 API 成本,缓存命中时响应速度最高可提升 15 倍。
LangCache 的工作方式
LangCache采用双调用循环。应用在调用 LLM 之前,会先把提示词发送到 LangCache,进行向量相似性搜索。
- 如果找到语义接近的已缓存条目,系统会直接返回缓存响应,无需调用 LLM;
- 如果未命中,应用则正常调用 LLM 生成响应,并将该提示词与响应写入缓存,供后续请求使用。
服务内置嵌入模型生成功能,也支持用户自带模型。
接入方式与配置项
LangCache可通过 REST API 访问,也提供 Python 和 JavaScript SDK。缓存行为支持通过相似性阈值、TTL 以及淘汰策略等参数进行配置。
在 Redis Cloud 控制台中,用户还可以查看缓存命中率和成本节省情况。
公开案例
客户 Mangoes.ai 表示,其患者护理应用已经实现 70% 的缓存命中率。
该消息由 MarkTechPost 披露。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

