问题
现有 AI 编程 agent 擅长“修一个已经被告知的 bug”,但几乎不会主动发现 bug。SWE-Sweep 的测试结果很直白:"models still are terrible at it (best setup we tested still fixed < 5% of bugs)",而且成本很高。也就是说,今天把 coding agent 接进代码库,它并不会替你发现潜伏缺陷;工程团队仍然主要靠用户报障、测试失败或线上事故才知道 bug 的存在。同时,SWE-Bench Pro V2 显示 top 模型(GPT-5、Claude Opus 4.1)在多文件复杂场景下得分仅约 23%,说明这个能力缺口是真实且被量化的,而现有评测体系(SWE-bench 等)只测“已指出问题的修复”,不测主动发现——团队既没有工具,也没有衡量标准。
目标用户
AI/开发者工具团队、以及维护大型代码库的工程团队(平台工程、SRE、QA 负责人)。信号来自 Hacker News 和 TLDR AI,受众是全球开发者社区,但均为评测和模型视角,尚无一线工程团队明确表达付费需求,市场规模只能定性判断为“有代码库的团队普遍存在潜伏 bug,但需求强度未验证”。
解决方案
- 主动巡检 agent:定时扫描代码库变更,主动寻找潜在缺陷(而非等 bug 被指出),定位到具体文件与代码路径
- 证据链输出:每个候选 bug 附上触发条件、可疑代码位置和置信度,降低人工确认成本
- 复现优先:自动生成最小复现思路或测试用例草稿,把“疑似”变成“可验证”
- 成本与模型路由:支持混合使用便宜模型(如 GPT-5.4 Mini、Gemini 3.5 Flash Lite)做初筛、强模型(Opus、Sol)做深查,控制单位 bug 的发现成本
- CI 集成与去噪:接入 PR 流水线,聚合重复告警,按风险排序
AI 的角色:核心执行者——代码理解、缺陷假设生成、复现构造;但信号表明当前模型能力不足,产品价值很大程度取决于搜索策略与工程化去噪,而非裸模型能力。
为什么是现在
SWE-Sweep(2026-10)首次提供了衡量“主动找 bug”能力的公开基准,让这类产品的效果第一次可量化、可对标;SWE-Bench Pro V2(2026-09)也刚把多文件复杂场景的短板(top 模型仅 ~23%)摆上台面。评测体系的补齐意味着团队开始正视“发现”而非“修复”这一缺口,是切入的好时机。但注意:信号显示的是模型能力仍然不足,而非新能力解锁,时机判断置信度偏低。
MVP 范围
第一版:接入单个 GitHub 仓库,定时跑“巡检 agent”,输出候选 bug 清单,每条附上证据(触发路径、最小复现思路、置信度),由人工审核确认。
明确不做:自动向仓库提交 PR、自动修 bug(信号显示模型修复率 <5%,自动修反而制造噪音)、多语言全栈支持(先只支持 1-2 种语言如 Python)、自研评测基准(直接复用 SWE-Sweep 衡量自身效果)。
风险
- 技术风险(最大):信号本身证明模型主动找 bug 的成功率 <5% 且成本高,产品可能长期停留在“高误报清单”状态,无法交付可感知价值。
- 开源替代:SWE-Sweep 已开源(github.com/facebookresearch/swe-sweep),AI lab 会优先改进自家模型而非采购第三方工具。
- 平台依赖:深度绑定 GitHub/CI 生态,政策或接口变动影响大。
- 巨头挤压:GPT-5、Opus 4.1 等模型厂商一旦补上该能力,会直接内置进自家 agent 产品。
- 成本风险:大规模扫库的推理成本高,信号中明确提到测试成本 "at very high cost"。
已有产品
| 产品 | 定位 | 价格 |
|---|---|---|
| SWE-Sweep | 首个衡量模型主动找 bug 能力的基准,与“先发现 bug”这一问题最直接相关 | — |
| SWE-bench | 最广泛使用的修 bug 基准,定义了现有评测范式 | — |
| SWE-Bench Pro V2 | 多文件复杂场景评测,暴露 top 模型仅 ~23% 的短板 | — |
| SWE-Bench Verified | 人工校验版修 bug 基准 | — |
| ProgramBench | 信号中提到的相关编程能力评测 | — |
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
Hacker News · Show HN10月1日新能力▲ 52 条评论隐含付费意愿
“Turns out that models still are terrible at it (best setup we tested still fixed < 5% of bugs)”
Current AI models are terrible at proactively finding bugs, with the best tested setup fixing under 5% of bugs and at very high cost.原文
Hacker News · Show HN10月1日新品发布▲ 52 条评论
“Most benchmarks just test if AI can fix a problem you've already pointed out.”
Most benchmarks only test whether AI can fix a bug that has already been pointed out, rather than whether it can find bugs proactively.原文
TLDR AI9月23日新品发布
“SWE-BENCH PRO V2 releases with 642 tasks from 11 repositories, correcting previous task errors and optimizing evaluation processes.”
SWE-Bench Pro V2 released with 642 tasks from 11 repositories, where top models like GPT-5 and Opus 4.1 score only around 23%, exposing weakness in complex multi-file coding scenarios.原文