论文
晶体生成器离散合成流的强化学习:经验证的收益与奖励漏洞
Reinforcement Learning on the Discrete Composition Channel of a Crystal Generator: Validated Gains and Reward Hacking
摘要
逆向材料设计是计算材料发现的长期目标。晶体材料的生成模型通常经过训练以匹配结构数据库的分布,而其训练目标中没有任何内容指向它们特定的设计目标,例如目标属性。我们使用组相对策略优化(GRPO)通过强化学习将基于随机插值和离散流匹配的生成模型与一般黑盒奖励函数对齐。原子类型是由离散流生成的,我们对 GRPO 的概括的策略梯度直接作用于原子类型转换的可能性,这使我们的工作与之前用于扩散和基于流的晶体材料生成模型的强化学习方法不同。我们引入了一种奖励函数,根据社区基准的评估,该函数将亚稳态、独特和新颖结构 (mSUN) 的产量从预训练模型的 13.4% 提高到强化模型的 45.5%。我们的奖励还提高了基于潜在去噪扩散模型的晶体材料强化学习框架的性能。与此同时,我们发现直接增强原子型转变可能性可以实现奖励利用,而必须通过明确的保护措施来防止这种情况。相同的分析还暴露了社区指标中的差距。不同堆积形式的单元素结构被视为亚稳态、独特和新颖的材料,并且使 mSUN 膨胀而不会产生任何新化合物。稳定性声明的好坏取决于其参考凸包。我们按支撑结果的参考相数量分组报告全部结果,并认为基准测试也应该这样做。
