论文

CausalFlow:LLM 代理故障的因果归因和反事实修复

CausalFlow: Causal Attribution and Counterfactual Repair for LLM Agent Failures

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 代理经常在涉及推理、工具使用和环境交互的多步骤任务中失败。虽然此类失败通常会被记录或启发式重试,但它们包含有关执行失败位置的结构化信号。我们引入了 CausalFlow,这是一种干预框架,可将失败的代理跟踪转换为最小的反事实修复和可重用的监督。 CausalFlow 将执行跟踪建模为相关步骤的顺序链,并通过步骤级反事实干预来计算因果责任分数 (CRS),以识别导致失败的步骤。对于这些步骤,我们生成最少编辑的修复,使最终结果成功,生成经过验证的形式对比对(错误步骤,纠正步骤)。 CausalFlow 支持两种互补的用途:有针对性的测试时修复,以最小的行为漂移从故障中恢复,以及适合离线偏好优化或奖励建模的训练时监督。在涵盖数学推理、代码生成、问答和医疗浏览的四个基准测试中,CausalFlow 将失败的执行转换为具有高最小性和因果一致性分数的经过验证的最小修复,并证明因果归因对于跨不同代理任务的可靠改进是必要的,在复杂的检索设置中优于启发式细化,同时在整个过程中产生更多的本地化修复。这些结果表明,对结构化执行跟踪的干预分析提供了一种原则性的、可扩展的机制,用于将代理故障转化为可靠性增益和学习就绪的监督。