论文
C-MORAL:LLM 的可控多目标分子优化与强化对齐
C-MORAL: Controllable Multi-Objective Molecular Optimization with Reinforcement Alignment for LLMs
摘要
大语言模型 (LLM) 显示出分子优化的前景,但将它们与选择性和竞争性药物设计约束相结合仍然具有挑战性。我们提出了 C-Moral,一种用于可控多目标分子优化的强化学习 后训练 框架。 C-Moral 结合了基于组的相对优化、异构目标的属性得分对齐以及瓶颈敏感的非线性奖励聚合,以提高竞争分子属性的稳定性。在 C-MuMOInstruct 和 S$^2$-Bench MolOpt 上的实验表明,C-Moral 在两个基准测试的比较方法中实现了最佳性能。在 C-MuMOInstruct 上,C-Moral 在域内任务上实现了 48.9% 的最佳成功优化率 (SOR),在域外任务上实现了 39.5% 的最佳成功优化率 (SOR),同时保留了支架相似性。在 S$^2$-Bench MolOpt 上,它还在 LogP、MR 和 QED 优化任务中取得了最强的结果。这些结果表明,C-Moral 是将分子 LLM 与连续和约束分子设计目标结合起来的有效方法。我们的代码和模型可在 https://github.com/Rwigie/C-MORAL 上公开获取。