论文
强化学习策略的文本解释及其评估
Textual Explanations and Their Evaluations for Reinforcement Learning Policy
摘要
理解强化学习(RL)策略对于确保自主智能体按人类期望行事至关重要。这一目标可以借助可解释强化学习(XRL)技术实现。尽管文本解释易于被人类理解,但确保其正确性仍是一个挑战,且最先进工作中的评估仍然有限。我们提出一个新颖的XRL框架,用于生成文本解释、将其转换为一组透明规则、改进其质量并加以评估。专家知识可以被纳入该框架,我们还提出了一种自动谓词生成器,用于确定状态的语义信息。文本解释使用大语言模型(LLM)和聚类技术生成,以识别频繁出现的条件。这些条件随后被转换为规则,以评估其属性、忠实度以及在部署环境中的性能。我们提出两种细化技术来提高解释质量并减少冲突信息。实验在三个开源环境中进行以保证可复现性,并在一个电信用例中评估所提XRL框架的工业适用性。该框架解决了现有方法Autonomous Policy Explanation的局限,生成的透明规则可以在某些任务上取得令人满意的性能。该框架还支持对文本解释进行系统化、定量的评估,为XRL领域提供了有价值的见解。
