OneLastIdea

本地 LLM Agent 负载基准测试工具

开发者用真实 agent 轨迹回放,得到 llama.cpp、MLX 等本地推理配置的可复现性能对比。

  • API / 基础设施
  • B2B
  • 中国
  • 难度 3/5
  • 启动 < $500
  • MVP 约 4 周

问题

在本地跑 LLM agent 工作流的开发者需要评估推理引擎性能,但现有自报式基准数据不可信。HN 评论者直接质疑:"There's a ton of variance possible in llama.cpp's performance depending on how it was configured. I'd also like to see benchmarks against MLX." 痛点在于:合成基准(单轮补全、固定 prompt)与真实 agent 负载(多轮、长上下文、工具调用交错)差异巨大,同一引擎不同配置下性能差异极大,开发者缺少可复现、贴近真实负载的评测方法。

目标用户

在本地(工作站/服务器)运行 LLM 服务 agent 应用的开发者和中小团队;从信号看这是一个开发者利基市场,HN 上对基准方法论的质疑说明关注者存在,但规模无法从现有信号判断。

解决方案

核心功能

  • 轨迹回放引擎: 导入真实 agent 会话轨迹(Claude Code 等工具产生的多轮请求流),按原始时序回放到本地推理服务。
  • 配置矩阵测试: 一键对 llama.cpp、MLX 等引擎在不同量化、上下文长度、线程配置下跑同一轨迹集,消除"配置带来的巨大方差"。
  • 贴近 agent 负载的指标: 报告 TTFT、tokens/s、多轮上下文增长下的性能衰减,而非传统单轮补全分数。
  • 可复现报告: 输出包含完整配置与轨迹哈希的对比报告,直接回应"Any source on the benchmarks/methodology"式质疑。

AI 的角色: 被测对象本身是 LLM serving;产品还可用 LLM 自动聚类轨迹、识别典型 agent 请求模式,生成有代表性的基准负载。

为什么是现在

两个信号都指向同一个时点:agent 工作流正在成为本地 LLM 的主要负载(轨迹回放这一新方法在 2026 年 9 月刚开源),同时开发者开始公开质疑旧式自报基准的可信度——评测方法论与真实负载之间的落差刚刚暴露,还没有成熟的第三方工具填补。

MVP 范围

做: 支持导入常见格式(如 Claude Code、OpenAI 兼容格式)的 agent 会话轨迹;针对 llama.cpp 与 MLX 两个引擎做回放基准测试;输出 TTFT、吞吐、延迟分布等对比报告。 不做: 不做通用压测、不做云端 API 基准、不做模型训练或量化调优建议、不做 SaaS 托管。

风险

  • 付费风险: 目标用户是开发者,普遍预期此类工具免费开源,商业化路径不明,信号中完全没有付费意愿证据。
  • 开源竞争: aa-agentperf-local 已经开源了同样的核心思路,可能快速吸收关注并成为默认标准。
  • 维护负担: llama.cpp、MLX 等引擎迭代快,配置项繁多,适配矩阵会持续膨胀。
  • 信号薄弱: 仅两条信号,一条是项目发布,一条是单条 HN 评论,真实需求规模无法确认。

已有产品

产品定位价格
ArtificialAnalysis/aa-agentperf-local开源项目,通过回放真实 agent 轨迹来基准测试本地 LLM serving,与本机会高度重合,是最直接的先例。—

信号证据

这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。

  1. Hacker News · Launch HN9月30日讨论

    “Any source on the benchmarks/methodology besides the image? There's a ton of variance possible in llama.cpp's performance depending on how it was configured. I'd also like to see benchmarks against MLX.”

    Commenter challenges the validity of self-reported inference benchmarks, noting llama.cpp performance varies widely with configuration and asking for comparisons against MLX.原文

  2. GitHub · 新的 Agent 项目9月26日新能力▲ 73

    “Benchmark local LLM serving by replaying real agent trajectories”

    Benchmarking local LLM serving by replaying real agent trajectories.原文

这个 Idea 怎么样?

相似的 Idea

  • 42

    面向本地多智能体会话的推理引擎

    让开发者在个人电脑上同时跑多个长时间智能体会话,共享前缀缓存、动态分配内存,不影响电脑做其他事。

    3 条信号,1 个来源,最近 前天

    开发者工具
    • 桌面 App
    • B2B
    • 全球
    • 难度 5/5
    • 启动 $5k–50k
    • MVP 约 20 周
  • 42

    本地与慢模型编程 Agent 的工具调用加速层

    让运行在慢速模型上的编程 Agent 不再被工具调用卡住,编译、测试等长任务可预取或并行执行。

    2 条信号,2 个来源,最近 昨天

    开发者工具
    • API / 基础设施
    • B2B2C
    • 全球
    • 难度 5/5
    • 启动 > $50k
    • MVP 约 12 周
  • 50

    记忆型 Agent 的自述审计工具

    为带有记忆模块的 agent 提供审计工具:核对系统宣称的记忆能力与实际执行记录,标出未被支持的声明。

    2 条信号,1 个来源,最近 昨天

    开发者工具
    • SaaS
    • B2B
    • 全球
    • 难度 3/5
    • 启动 $500–5k
    • MVP 约 8 周

本页内容由 AI 根据公开讨论整理,最后更新于 24分钟前。发现错误或需要下架原文,请看这里。