论文

通过顺序 微调 进行分子设计的约束流优化

Constrained Flow Optimization via Sequential Fine Tuning for Molecular Design

模型训练强化学习

摘要

适应生成基础模型,特别是扩散和流动模型,以优化给定的奖励函数(例如,结合亲和力),同时满足约束(例如,分子可合成性),是它们在现实世界的科学发现应用(例如分子设计或蛋白质工程)中采用的基础。虽然最近的工作通过强化学习和控制方案引入了此类模型的奖励引导 微调 的可扩展方法,但如何以可靠且可预测的方式在算法上权衡奖励最大化和约束满足仍然是一个悬而未决的问题。受这一挑战的激励,我们首先提出了一个严格的约束生成优化框架,该框架为引入的适应问题带来了优化观点,并将约束生成的相关任务作为子案例进行检索。然后,我们引入约束流优化 (CFO),这是一种通过已建立的可扩展方法将原始问题简化为顺序 微调 来自动且可证明地平衡奖励最大化和约束满足的算法。我们通过 CFO 为约束生成优化和约束生成提供收敛保证。最终,我们对 CFO 在合成的、说明性的设置和分子设计任务方面进行了实验评估。在这些评估中,CFO 在确保高约束满意度的同时实现了奖励的持续增加,展示了其对于约束生成优化的实用性。