论文

CrystalReasoner:面向性质条件化晶体结构生成的推理与强化学习

CrystalReasoner: Reasoning and RL for Property-Conditioned Crystal Structure Generation

模型训练强化学习

摘要

生成建模已成为发现晶体结构的一种有前景的方法。然而,现有的基于LLM的生成模型在低水平的原子精度方面存在困难,而基于扩散的方法在整合高水平的科学知识方面存在不足。因此,生成的结构通常是无效的、不稳定的或不具备所需的特性。为了解决这一差距,我们提出了 CrystalReasoner (\method),这是一种端到端的 LLM 框架,可通过推理和对齐从自然语言指令生成晶体结构。 \方法引入物理先验作为思维标记,其中包括晶体学对称性、局部配位环境以及在生成原子坐标之前预测的物理性质。这弥合了自然语言和 3D 结构之间的差距。然后,该方法采用具有多目标、密集奖励函数的强化学习(RL),使生成与物理有效性、化学一致性和热力学稳定性保持一致。对于属性条件任务,我们设计特定于任务的奖励函数并训练离散约束(例如空间群)和连续属性(例如弹性、热膨胀)的专用模型。实证结果表明,与之前的工作和没有思考痕迹或强化学习的基线相比,该方法在不同的指标上获得了更好的性能,是 S.U.N. 的三倍。比率,并为财产调节发电实现更好的性能。该方法还表现出自适应推理,随着原子数量的增加而增加推理长度。我们的工作展示了利用思维轨迹和强化学习来生成有效、稳定和属性调节的晶体结构的潜力。请在 https://crystalreasoner.github.io/ 上查看我们的工作。

CrystalReasoner:面向性质条件化晶体结构生成的推理与强化学习
图 1:CrystalReasoner 管道概述。 LLM 经过微调,首先以从抽象到具体的方式生成思维轨迹,然后再输出原子坐标。多目标密集奖励用于 RL (GRPO) 对齐。该模型可用于公式条件生成,并且可以进一步专门化为财产条件生成的财产特定奖励。