论文
CIVeX:语言智能体的因果干预验证
CIVeX: Causal Intervention Verification for Language Agents
摘要
有效的工具调用不一定是有效的干预。使用工具的语言代理受到模式验证器、策略过滤器、来源检查、状态预测器和自我验证的保护,但此类保护措施并不能证明状态更改操作具有可识别的因果效应。在混乱的工作流程中,在观察日志中看起来最佳的操作在执行时可能会降低效用。我们引入了 CIVeX,一种因果干预验证器,它将提议的操作映射到已提交的操作状态图上的结构因果查询,检查可识别性,并返回四个可审计判决之一:执行、拒绝、实验或弃权。执行需要一个假设范围的因果证明,其中包含图承诺、识别论证、单方面的置信下限 (LCB)、出处和风险限制。在 Causal-ToolBench(1,890 个实例,7 个种子)上,CIVeX 在中等和对抗性混杂中产生零观察到的错误执行。在对抗性混杂下,它达到了 84.9% 的准确率和 81.1% 的预言机效用(+2.23 vs +2.76),并且是唯一一种在零错误执行约束下的约束效用超过 AlwaysAbstain 下限的非预言方法。在 IHDP 和 ZOZO Open Bandit(具有统一随机基本事实的真实生产日志)上,CIVeX 在 0.1pp 内匹配 Oracle 正确执行,并将每次执行的错误执行比初始基线减少 >=50 倍。思想链 LLM 验证器(Claude Opus、Sonnet)在简洁的基线上将错误执行减少了一个数量级,但在对抗性混杂下,Opus 的效用下降至 CIVeX 的 74%。干预的可识别性,而不是行动的有效性,是可靠工具使用所缺失的原语。