论文
基于偏好的抗体表达排名:通过大规模弱监督进行扩展
Preference-based Antibody Expression Ranking: Scaling with Large-scale Weak Supervision
摘要
抗体表达排序是抗体设计中的一项关键任务,但其建模却因标记实验数据的缺乏而受到严重阻碍。为了解决这个问题,我们提出了一个统一的基于偏好的学习框架,它将稀缺的定量表达数据与来自免疫数据的大规模弱正监督相结合。我们通过引入联合屏蔽对数似然近似和基于 IMGT 的比对,将直接偏好优化 (DPO) 应用于蛋白质语言模型,从而实现对可变长度序列的有效训练。通过对包含 1254 个标记序列和 400 万个未标记的骆驼源抗体的多样化内部数据集进行评估,我们发现我们的方法在大多数指标上始终优于基线。我们的结果表明,偏好学习可以有效地从弱监督中学习,为数据受限环境中的抗体表达性优化提供可扩展的解决方案。项目页面:https://kisoji-biotechnology-inc.github.io/Preference-Expression-Ranking/。