问题
构建 MCP agent 的团队(如客服、临床场景)让模型同时调用多个工具和数据源后,会出现信号所称的 cross-source conflation:'a claim that is true somewhere in the evidence, but attributed to the wrong source'。现有 RAGAS Faithfulness、MiniCheck 等忠实度检查器将所有证据合并成一个匿名上下文,声明只要'在某处为真'就能通过验证,归属错误照样放行。对数据敏感场景(临床、客服引用票据)来说,引用错误来源的答案等于错误答案。
目标用户
构建或运维 MCP 式 LLM agent 的工程团队,尤其是数据敏感场景(信号提到客服、临床 agent);市场规模定性判断为中小——处于 agent 评测/可观测性这一细分赛道,需求随 MCP agent 普及而增长。
解决方案
- 来源感知拦截网关:作为黑盒 MCP agent 之上的后处理层,代理工具调用与响应,无需重训或修改 agent 内部。
- 声明拆解引擎:将 agent 回答分解为原子声明,保留每条声明的指代表述。
- 逐来源归因验证:对每条声明在其各候选来源内分别验证归属,而非合并后的匿名证据池,输出 per-claim verdict(归属正确/错误/无来源)。
- allow/block 决策 API:对含错误归因的回答返回阻断或修正提示,供上层应用接入审核流。
- AI 角色:使用 NLI/embedding 类模型(如信号中提到的 DeBERTa、MiniLM)做声明-来源匹配判断,agent 本身保持黑盒。
为什么是现在
信号显示 MCP 式多工具 agent 正在普及,且现有忠实度工具(RAGAS Faithfulness、MiniCheck)均为来源盲验证,跨来源混淆这一失效模式刚刚被明确命名和系统分析;同时新的后处理验证能力(无需重训 agent、黑盒即插即用)刚刚可行,属于问题与技术方案同时出现的窗口期。
MVP 范围
做:以 MCP 网关/中间件形式拦截 agent 响应;将回答拆解为原子声明;对每条声明按来源逐一验证归属;输出 per-claim verdict 与 allow/block 决策;提供 Python SDK 与简单的回放调试界面。不做:不重训或修改底层 agent;不支持非 MCP 的工具协议;不做完整的 RAG 管线托管;暂不做实时流式响应的逐 token 验证。
风险
- 开源替代:信号本身就是 HF Blog 上的研究原型(ProvenanceGuard),底层依赖 MiniCheck、DeBERTa、MiniLM 等公开模型,护城河薄,需靠工程化(MCP 集成、低延迟、审计日志)而非算法本身。
- 付费验证缺失:两条信号均为博客内容,无任何付费意愿数据,可能止步于研究演示而非真实需求。
- 评测成本:逐声明、逐来源的 NLI 验证在长回答下推理成本和延迟显著,实时场景可能不可用。
- 基准依赖:效果依赖声明拆解和 NLI 判断的质量,边界 case(转述、多来源合成事实)容易误判,产生过多误报让用户关掉拦截。
- 生态绑定:深度绑定 MCP 协议,若协议演进或 agent 框架自带验证层,价值会被上游吸收。
已有产品
| 产品 | 定位 | 价格 |
|---|---|---|
| ProvenanceGuard | 信号中提到的研究原型,正是本机会的核心参考实现,可作为复现或封装对象 | — |
| RAGAS Faithfulness | 主流 RAG 忠实度评估框架,但将证据合并为匿名上下文,无法做逐来源归因 | — |
| MiniCheck | 轻量事实性检查器,只验证声明是否被证据支持,不区分来源归属 | — |
| AlignScore | 对齐式事实一致性打分模型,同为来源盲的验证方案 | — |
| SummaC-ZS | 摘要一致性 NLI 打分工具,不做来源级归因 | — |
| RARR | 事后归因修正研究方案,方向相近但非 MCP 场景产品 | — |
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
Hugging Face Blog9月29日新能力
“ProvenanceGuard is a post-generation verification layer that sits on top of a black-box MCP agent.”
ProvenanceGuard enables source-aware factuality verification for MCP-based LLM agents, emitting per-claim source verdicts and allow/block decisions without retraining the agent.原文
Hugging Face Blog9月29日痛点
“The failure mode we care about is one we call cross-source conflation: a claim that is true somewhere in the evidence, but attributed to the wrong source.”
MCP agent answers can cite facts to the wrong source: a claim true somewhere in the pooled evidence passes source-blind verification even though its attribution is wrong.原文