论文

最小见证强化学习

Minimal Witness Reinforcement Learning

模型训练强化学习

摘要

“足以产生结果的不可约条件是什么?”是计算和科学中最常见的问题之一。它的答案,最低限度的充分见证,就是我们所说的解释、机制和理由。这些问题通常需要多个最小见证人,但标准强化学习方法可能只能揭示一种解决方案或冗余解决方案。我们将这个问题形式化为最小见证人识别,并引入最小见证人强化学习(MWRL)。 MWRL 采用从策略中抽样的成功提案认证的集合的联合,并将每个提案归功于如果没有该提案,团体联盟将失去的覆盖范围。这种信用分配直接源自问题定义,统一了对单个黑盒验证器位的替代方案的最小性和恢复的要求。根据这一原则,我们推导出一个可恢复整个见证人族的值迭代规划器,以及一个可扩展到大语言模型的策略梯度 方法。在不同的实验设置中,MWRL 恢复了最少的见证人,而其他方法则返回冗余的超集或单个见证人。通过使证人家庭能够从验证者的反馈中学习,MWRL 将强化学习的范围扩展到单一解决方案优化之外。我们的代码可在 https://github.com/TSUITUENYUE/MWRL. 获取

最小见证强化学习:论文原图
图 3:铃木耦合最小反应条件集的摊销发现。 (a) 两个 保留测试 底物对及其真实反链。每排芯片都指定了一组允许与基线不同的最小尺寸(催化催化剂系统、溶剂、Pd 负载、T 温度)。 (b) 每个 保留测试 基板上的 召回率 在 32 个不同条件集的窗口内,每个策略的值按降序排列。条件和底物盲策略之间的阴影间隙是底物指纹添加的 召回率。