论文
ToolChain-CRC:检索和工具使用漂移下智能体AI的保形风险控制
ToolChain-CRC: Conformal Risk Control for Agentic AI Under Retrieval and Tool-Use Drift
摘要
现代人工智能代理检索文档、调用工具、检查中间信息,然后生成最终答案或操作。这就产生了一个风险控制问题,仅从最终答案中是看不出来的。即使检索较弱、工具输出错误或早期步骤不受支持,最终响应也可能看起来可以接受。我们提出了 ToolChain-CRC,一种用于在漂移下增强检索和使用工具的代理的保形风险控制方法。该方法将每个代理运行视为动作、观察和最终输出的完整轨迹。它构建阶梯级风险评分,将它们组合成轨迹风险评分,校准接受或干预规则,并添加随时警报,可以在最终答案之前停止有风险的运行。我们证明了可交换校准运行下的轨迹级风险控制,提供了具有可审计常数的漂移感知扩展,并通过超鞅结构证明了随时升级规则。实验涵盖合成工具链漂移、RAG/工具使用压力测试、公共 SQuAD 派生检索任务、无 API 代理 QA 案例研究、消融、目标风险敏感性检查、20 种子稳健性检查、漂移裕度审计和实时 RAG/工具使用代理基准测试。在这些设置中,仅最终答案校准可能会错过检索和工具故障,而轨迹级校准则使可接受的轨迹风险保持在目标以下。