论文

做你自己的老师:通过无监督奖励优化指导蛋白质语言模型

Be Your Own Teacher: Steering Protein Language Models via Unsupervised Reward Optimization

模型训练偏好优化

摘要

蛋白质语言模型 (PLM) 已成为可控生物分子设计的强大工具,但其 后训练 适应通常依赖于昂贵的湿实验室验证或精选的偏好数据集。为了克服这一监督瓶颈,我们引入了 PLM 的无监督奖励优化,这是一个无需 真值 标签的可操纵蛋白质生成的综合框架。我们的主要见解是,与任务无关的奖励将内在模型不确定性与蛋白质表示模型告知的外在语义一致性结合起来,表现出与跨基础模型和温度状态的可控性测量的强相关性。基于这一发现,我们提出了两种离线算法:软奖励优化(SRO)和二值化奖励优化(BRO),它们有效地最大化由这些代理奖励引起的经典 RLHF 目标。对成分分布外提示的大量实验表明,两种方法都显着优于竞争基线(DPO、KTO),同时在多个采样温度、模型规模和蛋白质家族上接近预言机性能。此外,与 pass@k 评估中的基本模型相比,通过无监督奖励进行微调的 PLM 可以持续实现更高的覆盖率。通过通过 PLM 自身生成的经验实现 PLM 的自我改进,我们的框架为在标记偏好或实验反馈稀缺或不可用的环境中实现可控生物分子设计提供了一条可扩展的途径。