论文

ProvenanceGuard:面向MCP的LLM智能体的来源感知事实性验证

ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents

智能体系统Agent 动作执行与治理智能体互操作协议MCP

摘要

工具使用的LLM智能体日益使用模型上下文协议(MCP)从异构证据源(搜索、API、数据库、临床记录与处方集工具)作答。标准事实性指标通常测试答案是否被汇集证据支撑——漏掉一种来源敏感的失败模式:一条声明可能在某处有支撑——却被归因到错误来源。我们称之为跨源混淆。我们介绍ProvenanceGuard——面向MCP锚定答案的来源感知验证器。它消费带稳定工具ID、来源ID与原始输出的捕获MCP踪迹;把答案分解为原子声明;把声明路由到来源专属证据;以NLI与token对齐代理检查支撑;比较声称的归因与路由到的来源;返回逐声明裁决加答案级放行/拦截决定。被拦截答案可经检索增广的答案修订修复并重验。我们在281条医疗域MCP智能体踪迹上评估。266条踪迹的裁决子集产出按踪迹划分的2,325个LLM辅助声明标签;361个留出标签经人工验证。在40条踪迹留出划分上——ProvenanceGuard对260条来源合格声明取得拦截F1 0.802、来源准确率0.858——超越不输出声明到来源ID的来源盲基线。在更难的多源基准上它达拦截F1 0.846——而来源+关系准确率降至0.229——表明在语义相近来源间精确归属仍困难。修复与重验解决全踪迹集中所有被拦截答案——常经保守回退。在50个受控临床混淆探针上——ProvenanceGuard检出全部注入的归因交换——无残留错误归因。这些结果表明来源归因是基于MCP智能体的事实性验证的独立轴。