论文

通过 logits 空间对比对齐将跨模态的生物语言模型置于语境中

Contextualizing Biological Language Models across Modalities via Logit-Space Contrastive Alignment

模型训练参数高效训练

摘要

预训练的生物语言模型通过屏蔽标记预测揭示每个标记的概率分布,提供序列设计、变异评分和机械解释的中心似然接口。然而,这些分布是从广泛的未标记语料库中学习到的,并不自然地以特定任务的生物背景为条件,例如相互作用伙伴、细胞环境或治疗干预。现有的上下文匹配方法经常通过池化嵌入、对比潜在空间或特定于任务的预测头来扭曲这个界面。我们引入了 LOGICA(logits 空间对比对齐),这是一个上下文条件预测框架,可直接在输出 logits 空间中执行对比学习。使用与每个模型的本机词元头兼容的门控跨模式适配器,LOGICA 保留了预训练的似然接口,并将上下文化的词元对数似然转换为匹配分数。对齐是通过上下文相关的标记概率而不是共享嵌入空间中的邻近度来定义的,从而能够从具有不同词汇表的模型中的稀疏配对数据中进行学习,而无需共享标记器或解码器。 LOGICA 对于突变局部变体排序特别有效,其中比较减少了扰动位点突变标记的上下文条件可能性。在蛋白质-配体结合、TCR-肽活性和药物条件耐药性预测方面,LOGICA 比以前最先进的方法有所改进,包括匹配的潜在对比和条件 MLM 基线,同时保留用于解释和生成的 词元级 接口。在保留基因单突变耐药性预测中,LOGICA 将 AUC 从近随机潜在空间基线 $\sim$0.55 提高到 $\sim$0.65。