论文
根据强化学习方法对修复代理错误的帮助程度来评估其可解释性
Evaluating RL Explainability Methods by How Much They Help Fix Bugs in Agents
摘要
这篇初步论文概述了可解释强化学习(XRL)方法的计划评估基准。当前的评估依赖于 忠实性 和紧凑性等基于功能的指标,以及主观评分或预测准确性等基于人的代理。我们建议通过 XRL 方法生成的解释帮助诊断和修复故障强化学习 (RL) 代理的有效性来评估 XRL 方法。我们提出了 EvalXRL,这是一个基准测试,其中 大语言模型 (LLM) 编码智能体 使用不同的 XRL 方法来诊断 RL 代理中的保留故障,然后修复它。我们提出的基准测试会迭代(环境$\times$故障$\times$XRL方法)元组,并使用RL代理的奖励信号来形成每个XRL方法的最终分数。 编码智能体 可以交互地使用该方法:调用 XRL 方法,处理其输出,对损坏的内容形成新假设,并使用调整后的参数再次调用该方法以测试这些假设。这种闭环结构可以被描述为科学方法的简化版本。一些 XRL 方法提供遵循此模式的自我评估;我们首次对闭环使用中的多种 XRL 方法进行了头对头比较。