问题
开发者给 LLM Agent 接入大型技能市场(230,000+ 技能)时,普遍依赖“LLM 中介检索循环”——在 Agent 决策循环里反复改写查询、筛选候选,既慢又贵,SkillSeek 论文测得单次试验花费高达 USD 51.30。同时,技能优化方法“largely overlook this accumulated knowledge”,只靠昂贵的 agent rollouts 迭代打磨技能,而忽视了网上已经公开分享的数百万个现成技能。会写检索的开发者不多,Agent 团队往往直接把选技能的活交给主 LLM,成本随技能库规模线性上升。
目标用户
构建 LLM Agent 的开发者和团队,尤其是接入 MCP 技能市场、技能数量在数千到数十万级的 Agent 产品团队。目前是研究者和小型 Agent 团队为主的小众市场,但随着技能市场(Agent Skills 等)增长,属于增速快、绝对规模尚小的早期市场。
解决方案
- 两阶段技能检索:BGE-base bi-encoder 粗筛 + 小型 cross-encoder 精排,替代 LLM 中介检索循环
- MCP 原生暴露:作为 MCP server 提供服务,Agent 主循环直接调用,不占用主 LLM 的上下文与调用预算
- 跨 harness 技能适配:参考 RASO 的 Cross-Harness Adaptation 思路,把检索到的公开技能改写到目标 Agent 的技能格式
- 成本看板:展示对比 LLM 中介检索的每次调用成本与命中率,让节省可量化(对标 USD 51.30 → USD 27.54) AI 的角色:不是让主 LLM 更聪明地选技能,而是用小模型(embedding + reranker)把“选技能”这件事从昂贵的 LLM 决策循环里拿出来。
为什么是现在
信号显示三件事同时发生:一是公开技能库已积累到“数百万个”量级,230,000+ 技能的市场让 LLM 中介检索的成本问题暴露(USD 51.30/试验);二是 MCP 成为技能暴露的标准接口,检索层可以做成即插即用组件;三是小模型(BGE-base + cross-encoder)的检索效果已能匹配 LLM 中介检索,成本降到 USD 27.54,方案在 2026 年 9-10 月被多篇论文同时验证。
MVP 范围
第一版做:对接一个主流 MCP 技能市场(如 Agent Skills),建索引并跑通两阶段检索,通过 MCP 接口返回 top-k 技能,附带单次调用成本对比(对标 USD 51.30 的 LLM 中介检索)。明确不做:Agent 端到端执行、harness 优化、新技能生成、多市场联邦检索。第一版不追求论文级 Pass@1 提升,只验证检索成本与命中率。
风险
- 开源替代:SkillSeek 本身开源免费,RASO 论文思路也已公开,护城河极薄,只能靠工程化、索引规模和托管服务取胜。
- 平台依赖:深度绑定 MCP / Anthropic 的 Agent Skills 生态,平台方一旦内置同类能力(如 SKILL.md 原生检索),产品价值瞬间归零。
- 证据薄弱:所有数据来自论文 benchmark(GAIA2、Terminal-Bench 2.0、SkillsBench),缺乏真实生产环境的付费用户验证。
- 基准漂移:技能市场内容与格式变化快,索引维护是持续成本。
已有产品
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
arXiv cs.IR10月1日新能力隐含付费意愿
“We present SkillSeek, an open-source two-stage skill retriever built from the standard IR recipe (a BGE-base bi-encoder feeding a small cross-encoder, exposed over MCP).”
SkillSeek, an open-source two-stage skill retriever (bi-encoder + cross-encoder over MCP), matches LLM-mediated agent skill retrieval at lower cost, with per-trial spend dropping from USD 51.30 to USD 27.54.原文
Hugging Face · Daily Papers10月1日新能力▲ 191 条评论
“ActiveSaddler consistently discovers stronger harnesses, improving test Pass@1 by 4.4 and 7.5 percentage points over the same harness optimizer using a scenario order fixed before optimization, respectively.”
Existing LLM agent harness optimization methods fix which training scenarios generate feedback, even though the most useful scenarios change as the harness evolves.原文
Hugging Face · Daily Papers9月29日新能力▲ 171 条评论
“Despite millions of publicly shared skills, existing skill optimization methods largely overlook this accumulated knowledge, instead relying solely on expensive agent rollouts to iteratively refine skills for a target task.”
Existing agent skill optimization methods overlook millions of publicly shared skills, relying solely on expensive agent rollouts to iteratively refine skills.原文