OneLastIdea

Agent 编程改动溯源审查工具

读取 Claude Code/Codex 会话记录,标记每处改动是你要求的还是 Agent 自行决定的,提交评审前可逐条验证。

  • 桌面 App
  • B2B
  • 全球
  • 难度 3/5
  • 启动 < $500
  • MVP 约 4 周

问题

重度使用 Claude Code / Codex 的开发者,提交 PR 前无法分辨哪些改动是自己明确要求的、哪些是 Agent 自行决定的,只能靠通读 diff 逐行验证,评审时也说不清每处改动的来源。信号 1 的原话:

目标用户

重度依赖 Claude Code / Codex 生成 PR 的个人开发者和小团队(信号 1 的目标用户),尤其是需要向他人提交评审、对 AI 改动负责的工程师。目前是较窄的早期采用者群体,但随 Agent 编程普及在扩大。

解决方案

  • 会话解析器:读取 Claude Code / Codex 本地会话记录,提取用户 prompt 与 Agent 响应中涉及的改动意图
  • Diff 对齐:将 PR/git diff 逐块与请求对齐,标注每处改动来源:用户明确要求 / Agent 自行决定 / 无法判定
  • 评审视图:提交前按来源筛选改动,优先人工核查“Agent 自行决定”的部分
  • 可分享标注:生成随 PR 附带的标注摘要,让评审者也能看到每处改动的出处
  • AI 角色:用 LLM 做请求与 diff 的语义匹配(规则匹配覆盖不了的改写、间接实现),溯源本身以解析和对齐为主

为什么是现在

Agent 编程工作流(Claude Code、Codex 会话式改代码)刚刚普及,改动量远超人工可逐行验证的规模,溯源问题才在 2026 年集中出现;同期 arXiv 上的 Reactant、NarrativeSteward 等研究开始系统验证

MVP 范围

首版:本地 CLI/插件,针对 git 仓库,读取 Claude Code 会话记录,对最近一次 commit/PR 的 diff 逐块标注来源(用户明确要求 / Agent 自行决定 / 无法判定),生成一份可随 PR 附上的标注摘要。明确不做:不支持 Codex 之外的多平台、不做文档/叙事类创作场景、不做自动修复或改动回滚、不接入云端审查系统。

风险

  • 平台依赖:核心数据是 Claude Code/Codex 的会话格式,无官方规范,对方一次更新就可能破坏解析;Codex 支持需另行适配。
  • 被平台吞并:Anthropic/OpenAI 完全可以原生内置改动溯源,届时独立工具价值归零。
  • 付费意愿存疑:三条信号均无付费意愿证据,开发者工具用户习惯免费,变现路径不明。
  • 竞争:Reactant、NarrativeSteward 等研究系统已验证同一思路,若产品化可能更快覆盖文档与代码全场景。

已有产品

产品定位价格
Reactant研究原型:通过类型化内联注释和事务协议记录每次请求、技能身份与词级对应关系,实现文档编辑的纵向溯源,方向一致但面向文档而非代码。—
NarrativeSteward研究原型:面向交互式叙事作者的编辑环境,含变更记录与执行验证,验证了—

信号证据

这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。

  1. arXiv cs.HC10月1日新能力

    “Writing with AI agents turns a paragraph into the outcome of many requests, yet the finished document rarely explains which request produced which change.”

    AI-assisted document authoring lacks a record of which agent request produced which change, making the finished document untraceable to its editing history.原文

  2. arXiv cs.HC10月1日新能力

    “As agents generate and revise extensive content, authors struggle to grasp its overall structure, local details, and relationships, complicating continued guidance.”

    AI agents generating extensive interactive narrative content make it hard for authors to grasp overall structure, local details, and relationships, complicating continued guidance.原文

  3. Hacker News · Show HN9月30日新能力▲ 156 条评论

    “If the change came from your own Claude Code or Codex session, it reads your prompts and marks which changes you asked for and which the agent decided on its own as well to help you validate it before submitting for others to review.”

    The tool reads Claude Code/Codex session prompts to mark which PR changes were requested by the developer versus decided by the agent, helping validate AI edits before submission.原文

这个 Idea 怎么样?

相似的 Idea

  • 40

    AI 编程代理 harness 定制与评测工具

    让 AI 编程代理的高级用户定制执行回路、子代理与路由,并用评测数据迭代自己的 harness 配置。

    3 条信号,3 个来源,最近 13小时前

    开发者工具
    • AI + 服务
    • B2B
    • 全球
    • 难度 4/5
    • 启动 $500–5k
    • MVP 约 8 周
  • 57

    AI 编程 Agent 的上下文审计开关

    让开发者一眼看到 AI 编程助手实际收到的隐藏上下文,并能一键关掉不想要的自动注入。

    3 条信号,2 个来源,最近 23小时前

    开发者工具
    • 桌面 App
    • B2C
    • 全球
    • 难度 3/5
    • 启动 < $500
    • MVP 约 6 周
  • 44

    面向 Agent 开发者的代码化编排与可观测工具

    让开发者在代码里定义多步骤 AI 工作流,每个 agent 决策都有可度量的状态和 trace,排查失败不再靠读巨型 prompt。

    2 条信号,2 个来源,最近 昨天

    开发者工具
    • API / 基础设施
    • B2B
    • 全球
    • 难度 4/5
    • 启动 $500–5k
    • MVP 约 8 周

本页内容由 AI 根据公开讨论整理,最后更新于 22分钟前。发现错误或需要下架原文,请看这里。