论文

ProteinOPD:实现蛋白质设计的有效且高效的偏好比对

ProteinOPD: Towards Effective and Efficient Preference Alignment for Protein Design

模型训练偏好优化

摘要

设计具有所需功能或特性的蛋白质是合成生物学和药物发现的核心目标。蛋白质语言模型(PLM)的最新进展使得能够生成高度可设计的蛋白质序列,而偏好比对提供了一种有前途的方法来引导设计实现所需的功能和特性。然而,它们经常引发对预先训练的知识的灾难性遗忘,降低基本的可设计性,并且无法平衡多个相互竞争的目标。为了解决这些问题,我们从 同策略 蒸馏 (OPD) 中汲取灵感,这是一种先进的 后训练 方法,以通过其模式搜索性质减轻灾难性遗忘而闻名。在这项工作中,我们提出了 ProteinOPD,一种多目标偏好对齐框架,可以有效平衡多个偏好目标,同时保持 PLM 固有的可设计性。 ProteinOPD 将预训练的 PLM 适配为特定偏好的教师,并通过 词元级 OPD 根据学生自己的轨迹将他们的知识提炼给共享学生。在此过程中,学生与加权教师的独特归一化几何共识保持一致,同时确保冲突下的有限优化。这弥补了 OPD 在多目标/教师协调方面的差距。大量实验表明,ProteinOPD 在不影响可设计性的情况下,在目标偏好方面取得了实质性进展,其训练速度比基于 RL 的比对竞争对手提高了 8 倍。