论文

REFLECT:LLM智能体踪迹中静默失败的干预支持错误归因

REFLECT: Intervention-Supported Error Attribution for Silent Failures in LLM Agent Traces

模型推理推理验证与自校正

摘要

大型语言模型(LLM)代理现在通过长的计划和执行跟踪来解决复杂的任务,但在已完成的跟踪中定位错误的能力仍然远远落后,特别是在\emph{无声故障}机制中。现有的方法通过分类器或大语言模型法官预测可疑步骤,或通过重试恢复正确答案,但没有一种方法可以将干预结果反馈给\emph{完善归因本身}。我们提出\methodname,一种通过诊断候选错误步骤、通过使用特定于诊断的补丁的受控重放来测试它、并使用经过验证的结果翻转作为对比证据来完善最终归因来缩小这一差距的方法。在跨域多跳推理的四个本地化基准中,\methodname 在所有四个基准的相同审核器方法中实现了最高的定位精度,在结构化工具使用跟踪方面获得了最大的收益,同时即使在无法获得真实答案的情况下也能提供可操作的本地化。

REFLECT:LLM智能体踪迹中静默失败的干预支持错误归因:论文配图
图 1:无声失败和纠正归因差距。 (a) 跟踪正常完成但产生错误的答案;没有任何步骤表示错误。 (b) 重试或自我反思可能会通过独立路径恢复正确答案,但这种成功并不能确定哪个原始步骤是决定性的。