论文
协议:蛋白质同源物搜索的后期交互检索
PROTOCOL: Late Interaction Retrieval for Protein Homolog Search
摘要
蛋白质同源性搜索是功能注释、结构预测和进化分析的基础,但在“暮光区”仍然具有挑战性,其中全局序列相似性较弱,经典比对方法失去敏感性。蛋白质语言模型提供了上下文感知的表示,可以提高这种情况下的比对敏感性。然而,先前基于蛋白质嵌入的检索流程通常将这些表示汇集到单个向量中,可能会掩盖局部基序、结构域或揭示远程同源性的保守残基。我们引入了 ProtoCol,一种将蛋白质表示为残基嵌入集的模型,并使用 ColBERT 风格的后期交互来测试残基水平比较是否可以改善同源检索。 ProtoCol 独立编码蛋白质,保持候选表示可预先计算,并使用 MaxSim 对残基嵌入对候选进行评分。在 SCOPe 超家族和 Pfam 家族基准上,ProtoCol 的性能优于序列组合、基于比对、池化 PLM 和经过训练的单向量基线,支持后期交互作为远程同源搜索的有效检索层。