论文

采用强化学习并为分子生成提供可验证的奖励

Adopting Reinforcement Learning with Verifiable Rewards for Molecular Generation

模型训练强化学习

摘要

利用 大语言模型 (LLM) 进行分子生成在化学和药物设计中显示出巨大的潜力。当前的方法主要依赖于数据集有限的监督训练或 微调,不足以捕获复杂的分子设计目标。虽然一些方法试图引导生成实现特定目标,但它们通常缺乏直接的优化机制,使得很难将生成的分子与所需的特性对齐。为了应对这些挑战,我们提出了 \textbf{LLMol},这是一个有原则的强化学习框架,它直接结合了目标分子生成的可验证奖励。关键的见解是将分子设计制定为目标条件序列预测任务,其中可验证的奖励充当明确的监督,以推动一代人实现期望的目标。 LLMol 遵循监督学习和强化学习相结合的两阶段训练范式。在第一阶段,大语言模型 经过监督微调以捕获化学语法和分子分布。在第二阶段,我们引入了具有可验证奖励的强化学习(RLVR),它直接集成基于属性的奖励信号来指导分子生成实现特定于任务的目标。为了解决离散序列优化中常见的高方差和不稳定性问题,我们采用了组相对策略优化(GRPO),这是一种稳定的 同策略 算法,可以平滑奖励信号并提高训练鲁棒性。该框架使 LLMol 能够有效处理一系列分子设计任务,包括单属性靶向(例如惩罚 logP、QED)和结构约束优化。实验结果表明,LLMol 始终优于现有方法,在不同的分子基准测试中实现了更高的成功率和更高的效率。