论文
因果代理重放:LLM-代理失败的反事实归因
Causal Agent Replay: Counterfactual Attribution for LLM-Agent Failures
摘要
当 LLM 代理失败时——发出不应有的退款、调用错误的工具、泄露数据——现有工具会回答发生了什么(可观察性)或是否通过(评估),但不会回答是哪一步导致了失败。明显的启发式方法是错误的:执行有害操作的步骤通常不是决定该操作的步骤,并且 LLM 判断归因是相关且不可靠的(Who&When 基准上最先进的步骤级准确度约为 14%)。我们提出了因果代理重放(CAR),它通过干预来回答这个问题:它将代理运行建模为结构因果模型,对步骤应用执行操作,并在相同的随机策略下重新执行前进的轨迹,测量结果分布的变化。我们定义了代理步骤上的干预代数、单步对比估计器(其承诺点规则解决了随机运行特定的混杂问题)以及预算限制蒙特卡罗沙普利估计器(在交互步骤之间分配信用)。每个效应均以置信区间报告。我们使用 真值 验证合成结构因果模型:对比估计器恢复关键步骤,Shapley 恢复两步交互(0.44、0.45、~0;效率总和 0.909 与解析 0.91)。 CAR 是开源的,在托管或免费的本地模型上运行。