论文

dIon:基于碎片的串联质谱自监督学习的不变性

dIon: Fragmentation-Based Invariance for Self-Supervised Learning of Tandem Mass Spectra

模型训练预训练

摘要

我们为肽串联质谱数据引入了一种新颖的不变性,解锁了自我监督的表示学习,从而改进了肽的从头测序。这种不变性利用了前体特性(质量和电荷)和碎片离子证据之间的物理关系,而不需要肽序列标签。我们引入了 dIon,它采用两个潜在预测任务来适应 DINO 框架,两者都恢复干净的教师模型表示:一个来自光谱混合,使用前体作为选择查询,另一个来自保留前体的部分光谱。第一个将前体信息与碎片离子证据联系起来;第二个可以防止代表性崩溃到该信息上。机械探针支持这两种效果,而消融显示完整目标表现最佳。在相同的端到端训练下,dIon 初始化在留出 MassIVE-KB 和 Kingdoms 测试集上从头开始比训练提高了从头肽精度的性能,提高了 5.5 和 8.4 个百分点,在更大的监督训练语料库上提高了 2.3 和 4.8 个百分点。由此产生的模型超越了在相同的贪婪解码协议下对多样化、多物种王国语料库进行完全监督的最先进的从头测序模型。与其他学习模型相比,在没有肽标签的情况下,dIon 可以学习强大的天然肽相似性几何结构;通过有限的肽监督适应,它在所有表示基准中实现了最佳检索和配对区分能力性能。