问题
信号指出,越来越强的模型正被包在'primitive systems'(原始简陋的系统)里,大量能力被白白浪费;Alex Zhang 在探讨'harness/agent-scaffold 设计能解锁多少被留在桌面上的能力'。另一条信号显示,一个基于 RLM(Recursive Language Models)的 harness 首个近似解决 ARC-AGI-3,表现超过 OpenAI 的 Astra,说明脚手架设计本身是能力差异的关键来源。痛点是:模型能力存在,但缺少好的 harness 把它释放出来。
目标用户
AI agent 框架开发者、agent harness/脚手架构建者、做 agent 产品的工程团队。市场偏小众、偏研究者/前沿工程师群体,规模有限但影响力和付费能力较高。
解决方案
核心思路:把 RLM 论文中验证有效的 harness 模式产品化,让开发者直接组合使用而非从零搭建。功能:- 上下文卸载:把长任务中的中间结果、探索过程自动移出主上下文,按需取回;- 代码执行:内置代码执行环境作为 harness 的核心组件;- 递归子 agent:任务可递归分解为子 agent,各层独立拥有完整上下文;- 共享记忆:跨 agent、跨层级共享的持久记忆模块;- 组合式脚手架:以上组件可组合,作为'组合泛化器',适配不同基座模型。AI 的角色:LLM 是被 harness 放大的对象,产品本身是对模型外的系统层设计。
为什么是现在
信号显示,RLM 式 harness 首个近似解决 ARC-AGI-3 且跑赢 OpenAI 的 Astra,证明脚手架设计带来的能力差距刚刚被实证;模型变强但被'primitive systems'包裹的落差正被业界明确指出,是能力红利与新工具之间的空档。
MVP 范围
第一版:提供上下文卸载 + 代码执行 + 递归子 agent 的最小可组合框架,附带在 SWE-bench 或类似基准上的复现示例。不做的:不做模型训练、不做通用终端产品、不做完整的共享记忆系统(可留到后续版本)。
风险
- 技术风险:harness 的收益在论文基准(ARC-AGI-3)上验证,未必迁移到普通开发任务;
- 人群风险:目标用户偏研究者,可能自己就能搭,付费意愿信号中未体现;
- 平台依赖:效果依赖基座模型(Claude Code、Kimi 等)的 API 与行为变化;
- 竞品风险:Claude Code、Codex 等现有工具持续迭代,可能把同等脚手架能力内置。
已有产品
| 产品 | 定位 | 价格 |
|---|---|---|
| Codex | 被信号提及的主流 agent 工具,同类 incumbent。不被采用。 | — |
| Claude Code | 被信号提及的现有 agent harness,代表主流现有工具,可能内置同类脚手架能力。不被采用。 | — |
| RLMs | 信号核心概念,是被讨论的模型/方法本身,非商业产品。不被采用。 | — |
| Prime Agent | 信号提及的 Prime Agent,可能是同类 agent 框架。但信号未给出足够信息判断其与本卡问题的匹配。不采用。 | — |
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
Latent Space10月2日新能力
“and an RLM based harness was the first to ~solve ARC-AGI-3 before OpenAI’s Astra:”
An RLM-based harness was the first to ~solve ARC-AGI-3, outperforming OpenAI's Astra.原文
Latent Space10月2日新能力
“Alex Zhang is exploring how much capability we’re leaving on the table by wrapping increasingly powerful models in primitive systems.”
Powerful AI models are being wrapped in primitive systems, leaving substantial capability unused that better harness/agent-scaffold design could unlock.原文