问题
自托管 LLM 应用(如 AnythingLLM)的用户在处理大型或静态数据集时,每次请求都要重新处理完整上下文,响应延迟高、计算浪费大。AnythingLLM 的 GitHub issue 中有用户明确请求支持 Cache-Augmented Generation(CAG)和 Key-Value Augmented Generation(KAG),希望“将外部知识预加载到模型的上下文窗口,并用 KV 缓存加速中间计算”。与此同时,模型厂商侧也在推进:OpenAI 在 GPT-6 中改进了 prompt caching(更高缓存命中率、诊断与控制手段),说明推理缓存正在成为生态的共性需求,但自托管侧缺少对应工具。
目标用户
自托管 LLM 应用的开发者和团队,尤其是用 AnythingLLM 类工具跑私有知识库、数据集基本静态、追求低延迟的中小学团队。目前需求信号主要来自开源社区 issue,属于小众但聚焦的技术人群,市场规模定性判断为小到中。
解决方案
- 静态知识预加载:把系统提示词和不变的文档一次性预加载为 KV cache,后续请求直接复用
- KV 缓存管理:对中间计算结果做 key-value 缓存,自动判断哪些前缀可复用
- OpenAI 兼容代理层:以代理形式接入现有自托管应用,无需改动业务代码
- 诊断面板:展示缓存命中率、延迟与成本对比,借鉴 GPT-6 caching diagnostics 的思路
AI 角色:本产品是 LLM 推理链路的优化层,不生成内容,而是让底层模型的 KV cache 机制被高效利用
为什么是现在
OpenAI 在 GPT-6 中显著改进 prompt caching(更高命中率、诊断、显式断点与控制),显示推理缓存正从 trick 变成一等公民能力;同时开源社区(AnythingLLM 用户)已主动提出 CAG/KAG 需求,两侧信号在 2024 底到 2026 年间先后出现,说明这是正在升温的技术拐点。
MVP 范围
第一版只做:针对一组主流开源模型(如 Llama 系列),在固定系统提示词 + 静态知识文档场景下提供 KV cache 预加载与复用,输出延迟对比基准,并以 OpenAI 兼容 API 暴露给现有应用。明确不做:训练或微调、多模态、自动化的缓存淘汰策略、与 AnythingLLM 的深度集成(留作后续插件)。
风险
平台吸收风险:AnythingLLM 等开源平台可能自己实现 CAG/KAG 支持,使独立工具失去入口。 上游侵蚀:OpenAI GPT-6 等模型厂商持续内建更优缓存,可能让 API 用户不再需要自托管缓存层。 技术风险:KV cache 预加载与 vLLM/SGLang 等推理框架的兼容性维护成本高,框架版本迭代快。 需求强度存疑:原始 feature request 互动量低(score 13、1 条评论),pain 评级仅 3,真实付费需求未经验证。
已有产品
| 产品 | 定位 | 价格 |
|---|---|---|
| AnythingLLM | 用户请求 CAG/KAG 支持的开源平台,可能原生实现并吸收该需求 | — |
| GPT-6 | API 侧的一等公民缓存能力,但仅覆盖 OpenAI 模型,不解决自托管场景 | — |
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
OpenAI News9月22日新能力
“Learn how GPT-6 improves prompt caching with higher cache hit rates, new diagnostics, explicit breakpoints, and controls that reduce latency and costs.”
GPT-6 improves prompt caching with higher cache hit rates, new diagnostics, explicit breakpoints, and controls that reduce latency and costs.原文
GitHub Issues · Mintplex-Labs/anything-llm12月30日功能请求▲ 131 条评论
“I would like to request the addition of support for Cache-Augmented Generation (CAG) and Key-Value Augmented Generation (KAG) in the platform.”
AnythingLLM users want support for Cache-Augmented Generation (CAG) and Key-Value Augmented Generation (KAG) to improve response efficiency and reduce latency.原文