问题
在本地跑 LLM agent 工作流的开发者需要评估推理引擎性能,但现有自报式基准数据不可信。HN 评论者直接质疑:"There's a ton of variance possible in llama.cpp's performance depending on how it was configured. I'd also like to see benchmarks against MLX." 痛点在于:合成基准(单轮补全、固定 prompt)与真实 agent 负载(多轮、长上下文、工具调用交错)差异巨大,同一引擎不同配置下性能差异极大,开发者缺少可复现、贴近真实负载的评测方法。
目标用户
在本地(工作站/服务器)运行 LLM 服务 agent 应用的开发者和中小团队;从信号看这是一个开发者利基市场,HN 上对基准方法论的质疑说明关注者存在,但规模无法从现有信号判断。
解决方案
核心功能
- 轨迹回放引擎: 导入真实 agent 会话轨迹(Claude Code 等工具产生的多轮请求流),按原始时序回放到本地推理服务。
- 配置矩阵测试: 一键对 llama.cpp、MLX 等引擎在不同量化、上下文长度、线程配置下跑同一轨迹集,消除"配置带来的巨大方差"。
- 贴近 agent 负载的指标: 报告 TTFT、tokens/s、多轮上下文增长下的性能衰减,而非传统单轮补全分数。
- 可复现报告: 输出包含完整配置与轨迹哈希的对比报告,直接回应"Any source on the benchmarks/methodology"式质疑。
AI 的角色: 被测对象本身是 LLM serving;产品还可用 LLM 自动聚类轨迹、识别典型 agent 请求模式,生成有代表性的基准负载。
为什么是现在
两个信号都指向同一个时点:agent 工作流正在成为本地 LLM 的主要负载(轨迹回放这一新方法在 2026 年 9 月刚开源),同时开发者开始公开质疑旧式自报基准的可信度——评测方法论与真实负载之间的落差刚刚暴露,还没有成熟的第三方工具填补。
MVP 范围
做: 支持导入常见格式(如 Claude Code、OpenAI 兼容格式)的 agent 会话轨迹;针对 llama.cpp 与 MLX 两个引擎做回放基准测试;输出 TTFT、吞吐、延迟分布等对比报告。 不做: 不做通用压测、不做云端 API 基准、不做模型训练或量化调优建议、不做 SaaS 托管。
风险
- 付费风险: 目标用户是开发者,普遍预期此类工具免费开源,商业化路径不明,信号中完全没有付费意愿证据。
- 开源竞争: aa-agentperf-local 已经开源了同样的核心思路,可能快速吸收关注并成为默认标准。
- 维护负担: llama.cpp、MLX 等引擎迭代快,配置项繁多,适配矩阵会持续膨胀。
- 信号薄弱: 仅两条信号,一条是项目发布,一条是单条 HN 评论,真实需求规模无法确认。
已有产品
| 产品 | 定位 | 价格 |
|---|---|---|
| ArtificialAnalysis/aa-agentperf-local | 开源项目,通过回放真实 agent 轨迹来基准测试本地 LLM serving,与本机会高度重合,是最直接的先例。 | — |
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
Hacker News · Launch HN9月30日讨论
“Any source on the benchmarks/methodology besides the image? There's a ton of variance possible in llama.cpp's performance depending on how it was configured. I'd also like to see benchmarks against MLX.”
Commenter challenges the validity of self-reported inference benchmarks, noting llama.cpp performance varies widely with configuration and asking for comparisons against MLX.原文
GitHub · 新的 Agent 项目9月26日新能力▲ 73
“Benchmark local LLM serving by replaying real agent trajectories”
Benchmarking local LLM serving by replaying real agent trajectories.原文