论文

通过功能感知掩蔽学习任务特异性抗体表示

Learning Task-Specific Antibody Representations via Function-Aware Masking

模型训练预训练

摘要

通过掩码语言模型 (MLM) 预训练的抗体特异性语言模型学习对于下游序列设计和属性预测任务至关重要的表示。然而,在预训练期间,腐败过程本身很少被用作归纳偏差的来源。虽然优先屏蔽互补决定区(CDR)可以改善结合相关的预测,但抗体在多种功能上拥有不同的生物学先验。在这里,我们引入了功能感知掩码,这是一系列预训练算法,将掩码放置与特定的功能先验(例如,来自 IMGT 注释或结构预测)对齐,以塑造学习的表示空间。我们表明,这些专业掩蔽策略显着提高了各自目标的性能,在结构相关任务上提高了 14%,在 CDR 相关任务上提高了 5.9 倍。为了进一步提高多个功能轴的性能,我们开发了混合屏蔽策略,该策略集成了多个先验,平衡了结合、结构和生物物理目标的重建。我们的结果表明,知情掩模放置提供了一种无参数机制,用于在抗体语言 模型训练 中施加功能归纳偏差。