论文

晶体生成器离散合成流的强化学习:经验证的收益与奖励漏洞

Reinforcement Learning on the Discrete Composition Channel of a Crystal Generator: Validated Gains and Reward Hacking

模型训练强化学习

摘要

逆向材料设计是计算材料发现的长期目标。晶体材料的生成模型通常经过训练以匹配结构数据库的分布,而其训练目标中没有任何内容指向它们特定的设计目标,例如目标属性。我们使用组相对策略优化(GRPO)通过强化学习将基于随机插值和离散流匹配的生成模型与一般黑盒奖励函数对齐。原子类型是由离散流生成的,我们对 GRPO 的概括的策略梯度直接作用于原子类型转换的可能性,这使我们的工作与之前用于扩散和基于流的晶体材料生成模型的强化学习方法不同。我们引入了一种奖励函数,根据社区基准的评估,该函数将亚稳态、独特和新颖结构 (mSUN) 的产量从预训练模型的 13.4% 提高到强化模型的 45.5%。我们的奖励还提高了基于潜在去噪扩散模型的晶体材料强化学习框架的性能。与此同时,我们发现直接增强原子型转变可能性可以实现奖励利用,而必须通过明确的保护措施来防止这种情况。相同的分析还暴露了社区指标中的差距。不同堆积形式的单元素结构被视为亚稳态、独特和新颖的材料,并且使 mSUN 膨胀而不会产生任何新化合物。稳定性声明的好坏取决于其参考凸包。我们按支撑结果的参考相数量分组报告全部结果,并认为基准测试也应该这样做。

晶体生成器离散合成流的强化学习:经验证的收益与奖励漏洞的原论文方法或结果图
图 1:晶体生成器上的强化学习可以在没有真正发现的情况下满足基准,但奖励中的守卫会关闭漏洞。 (a) OMatG 生成器将具有屏蔽元素身份的噪声转化为晶体,并由 mSUN 在 LeMat-G​​enBench 下进行评分(第 4.1 节)。如果没有单元素保护,RL 会使预训练模型膨胀 13.4% 到 37.6%,但超过一半的 mSUN 集合是已知元素的单元素重新包装,例如被视为新型材料的面心立方 Mg。凭借完全奖励(右,第 3.3 节),将稀疏外壳结构路由至弃权,将单元素结构路由至惩罚奖励,mSUN 达到 45.5%,其中 0.4% 的单元素结构和在充分引用的外壳上经过 DFT 确认的化合物。 (b) 合成通道。在屏蔽离散流匹配下,每个原子的元素身份是一个具有精确对数概率的离散提交事件,而位置和晶格则作为连续的 SDE 演化(第 3.2 节)。