问题
两类开发者遇到同一个瓶颈:在本地跑 1 tok/s 级模型的开发者发现,Agent 推理循环每次工具调用都要停下来,"一个 ls 也要花几十秒";而跑 LLM 编程 Agent 的开发者发现,"编译器、测试套件和仓库级命令动辄几秒到几分钟,Agent 只能干等"。两种场景的痛感都来自同一个结构性问题:工具调用与推理循环是串行的,模型在等待结果时完全空转。
目标用户
自己部署本地 LLM 或使用较慢开源模型的编程 Agent 开发者和重度用户;包括用本地模型跑自动化任务、做 Agent 工具链调试的个人开发者,以及小型 Agent 创业团队。规模属于小众但技术热情高的极客群体,付费意愿尚不明确。
解决方案
- 推测执行沙盒:把长耗时工具(编译、测试、仓库命令)放入隔离的 copy-on-write 沙盒提前并行执行,验证通过后按依赖顺序提交结果
- 工具结果预取:把 harness 插件与推理循环融合,在模型明确需要某结果前就准备好,让模型"不用停,结果我已经给你拿来了"
- 依赖追踪与有序提交:追踪工具调用之间的依赖关系,乱序执行、按序提交,避免状态污染
- 本地模型适配:针对 tok/s 很慢的本地模型做调度优化,让单次工具调用的等待成本摊薄
为什么是现在
两个信号都指向同一时机:本地慢模型上的 Agent 工具链瓶颈刚刚被社区公开描述(Launch HN,2026-09),同日 arXiv 论文(2026-10-01)系统化提出乱序推测执行方案并给出 SWE-Marathon、Terminal-Bench 2.0 等评测基准,说明这个问题刚从个体抱怨进入可工程化解决的研究阶段,尚无成熟产品占位。
MVP 范围
首版做一个开源的 Agent harness 层:接现有本地推理框架,支持文件系统、shell、编译/测试三类工具的并行预取和推测执行,提供基础依赖追踪。暂不做:训练侧的 logit 干预、多 Agent 编排、云端模型优化、跨机器分布式沙盒。
风险
技术风险高:copy-on-write 沙盒和依赖追踪的正确性难以保证,工具副作用回滚是硬问题;推测执行浪费资源,对本来就慢的本地模型可能得不偿失。平台依赖:效果高度依赖底层推理框架的钩子能力,框架一升级接口就可能失效。商业化不明:两个信号均无付费意愿数据,目标用户偏极客,可能只接受开源免费。竞品节奏:arXiv 方案(SWE-Marathon、TomasuLLM 等)如果被主流 Agent 框架吸收,独立工具的价值会被迅速稀释。
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
arXiv cs.CL10月1日新能力
“Long-running tools can dominate coding-agent latency: compilers, test suites, and repository commands take seconds to minutes while the agent idles.”
Coding-agent latency is dominated by long-running tools like compilers and test suites while the agent idles.原文
Hacker News · Launch HN9月30日痛点
“So tool call step overhead can be painful - a world where `ls` costs tens of seconds. Plan is blending harness plugins with inference loop, for "no, don't stop - I already have the call result for you - just keep going"”
Tool call step overhead is painful with slow local models, where even an `ls` tool call can cost tens of seconds because the inference loop stops for each call.原文