论文
分子优化离散扩散在线自适应的设计空间
On the Design Space of Discrete Diffusion Online Adaptation for Molecular Optimization
摘要
分子优化通常从预先训练的生成模型开始,该模型捕获有效分子结构的广泛先验。然而,在测试时,目标不是从先前的样本中采样,而是使用有限的预言机预算将一代转向特定于任务的高奖励分子。我们研究离散扩散模型的适应问题。每个在线回合都会有几个选择。该循环必须决定评估哪些候选者、奖励如何成为模型更新、重用哪些反馈以及超出预先训练的范围多远。这些选择大多是孤立研究的,但它们是否相互补充、变得多余,还是干扰完整的在线适应循环,尚无定论。我们对六项小分子结合亲和力任务和三项蛋白质适应性任务进行了对照研究。我们发现获取、奖励塑造和模型去偏提供了获得更高奖励的补充途径,特别是对于小分子。重播进一步稳定了学习,而有效性惩罚则使小分子探索保持在有效的分子流形上。总之,这些发现指出了反馈高效分子优化的实用方法:具有获取、奖励塑造、去偏差、重放和有效性控制的在线 微调。在匹配的预言机调用预算和 GPU 小时会计下,此配方优于离线 微调 和推理时间搜索基线。当高回报候选人需要与预先训练的先前人员相比有更大的转变时,收益最大。