论文
用于反馈驱动代理修复的因果情景记忆
Causal Episodic Memory for Feedback-Driven Agent Repair
摘要
修复失败的 LLM 代理通常会放弃成功的更正,迫使后续事件重新发现类似的解决方案。我们研究最终的修复结果是否可以在不更新参数的情况下改善后续的文本到 SQL 事件。我们引入了 MERIT,一个 无需训练 代理,它维护经预言机验证的修正和观察到的不成功方向的在线双极性记忆。在预言机辅助基准反馈下,只有早期最终情节的记忆才有资格检索。确定性分类器分配粗略故障类型,该类型在冻结模型生成每个修订之前限制混合词汇密集 检索器。使用具有相同初始预测和修复预算的 Qwen2.5-7B-Instruct,\method{} 将无状态迭代修复的执行精度提高,在 Spider 上从 \(66.34\%\) 提高到 \(69.79\%\),在 BIRD 上从 \(47.35\%\) 提高到 \(48.44\%\)。配对分析为 Spider 增益提供了明确的证据,但为 BIRD 提供了较弱的证据。在这两个基准上,MERIT 都不能与非类型化动态检索可靠地分开,而反射式内存在 BIRD 上以更高的推理成本达到 \(51.24\%\)。消融表明负记忆的贡献不大,类型条件和词汇密集排名的价值取决于数据集,而模式本地经验提供了最一致的好处。这些结果阐明了因果交叉查询内存何时可以改善修复以及何时更广泛的内存表示仍然更可取。我们的实现可以在这里找到: