问题
推理工程师在运营 LLM 服务基础设施时,受限于现有推理引擎的吞吐瓶颈:在相同硬件上,vLLM 基线的 token 处理速度远低于理论极限。Quail 的发布说明查询感知(query-aware)推理可以在单个 H100 上达到每分钟超过十亿 token 的处理量,比 vLLM 基线快 10 倍以上。这意味着大量使用 vLLM 等通用引擎的团队在为吞吐不足支付更高的 GPU 成本。
目标用户
自建或运营 LLM 服务基础设施的推理工程师、AI 基础设施团队,以及需要高吞吐、低延迟批量推理的 AI 公司。市场规模取决于有多少团队选择自建推理而非调用 API,属于相对小众但付费能力强的技术人群。
解决方案
核心思路:借鉴查询感知推理的思路,针对特定负载模式(如批量处理、聚合查询)优化推理引擎。
- 查询感知调度:识别请求间的冗余与可共享计算,跳过重复 token 的前向传播
- 现有引擎集成:以 vLLM 插件或旁路层的形式接入,不要求用户重写服务栈
- 成本仪表盘:实时展示每十亿 token 的成本,方便和基线对比
- 云端一键部署:支持 Modal 等无服务器 GPU 平台的快速部署
AI 的角色:产品本身是推理加速层,AI 技术就是产品本体(查询感知推理、KV 缓存复用等)。
为什么是现在
2026 年 9 月 Quail 展示了查询感知推理的可行性:同硬件下吞吐比 vLLM 基线高 10 倍以上,且在 Modal 上的成本低于每十亿 token 0.06 美元。同时 NVIDIA Vera Rubin NVL72 等新硬件把每百万 token 成本再降一个量级,硬件红利与软件优化的叠加让推理成本优化的窗口期变短,早动手的团队优势更大。
MVP 范围
第一版:针对批量推理场景(如大规模文档处理、聚合分析类查询)实现查询感知的缓存复用与调度,以 vLLM 的扩展或 wrapper 形式提供,并在公开基准上复现 5-10 倍吞吐提升。
不做的:不做训练相关功能,不做通用实时对话场景的优化(该场景查询间复用空间小),不涉及自研推理 kernel 之外的整体引擎替换。
风险
技术风险:查询感知推理的效果高度依赖负载特征,对对话类实时请求可能收益有限;复现 Quail 的 10 倍提升对个人团队难度很大。
平台依赖:如果 vLLM 官方或其他大厂(如 NVIDIA)把类似优化直接合入上游,独立产品空间被压缩。
竞争风险:Quail 本身已是现成方案,且 NVIDIA 正在硬件层面(Vera Rubin NVL72)大幅降低单位成本,软件优化的相对价值可能被硬件进步稀释。
受众规模:自建推理的团队数量有限,天花板不高。
已有产品
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
NVIDIA Blog10月1日新能力隐含付费意愿
“SemiAnalysis AgentX data shows NVIDIA Vera Rubin NVL72 systems deliver over 30x higher throughput per megawatt than NVIDIA GB300 NVL72, and up to 45x lower cost per million tokens on the DeepSeek V4 Pro model.”
NVIDIA Vera Rubin NVL72 systems deliver over 30x higher throughput per megawatt than GB300 NVL72 and up to 45x lower cost per million tokens, changing the economics of AI inference.原文
TLDR AI9月28日新能力隐含付费意愿
“The QUery-Aware Inference Layer (Quail) is an inference engine that hits over a billion tokens processed per minute per H100 GPU. It is over 10 times faster than the vLLM baseline on the same hardware”
Current inference engines process far fewer tokens per GPU than a billion tokens per minute, limiting inference engineers serving LLM workloads.原文