论文
最小见证强化学习
Minimal Witness Reinforcement Learning
摘要
“足以产生结果的不可约条件是什么?”是计算和科学中最常见的问题之一。它的答案,最低限度的充分见证,就是我们所说的解释、机制和理由。这些问题通常需要多个最小见证人,但标准强化学习方法可能只能揭示一种解决方案或冗余解决方案。我们将这个问题形式化为最小见证人识别,并引入最小见证人强化学习(MWRL)。 MWRL 采用从策略中抽样的成功提案认证的集合的联合,并将每个提案归功于如果没有该提案,团体联盟将失去的覆盖范围。这种信用分配直接源自问题定义,统一了对单个黑盒验证器位的替代方案的最小性和恢复的要求。根据这一原则,我们推导出一个可恢复整个见证人族的值迭代规划器,以及一个可扩展到大语言模型的策略梯度 方法。在不同的实验设置中,MWRL 恢复了最少的见证人,而其他方法则返回冗余的超集或单个见证人。通过使证人家庭能够从验证者的反馈中学习,MWRL 将强化学习的范围扩展到单一解决方案优化之外。我们的代码可在 https://github.com/TSUITUENYUE/MWRL. 获取
