论文
蛋白质接触信息已编码在注意力中:一次前向计算替代分类雅可比方法
Protein contacts are already in the attention: a single-forward-pass alternative to the Categorical Jacobian
摘要
Zhang等人2024年提出的分类雅可比方法,逐一用其他氨基酸替换每个残基来读取蛋白质接触信息,需要约19L次前向计算。本文发现,接触信号已集中在少数注意力头中:仅用少至10个带标注蛋白质选出前K个相关头,不拟合残基对或注意力头权重,直接取平均即可在一次前向计算中恢复接触信息;在适用的双向模型中,除最小的8M模型外,表现达到或超过分类雅可比方法。CAMEO主评估排除了模型可能记忆的数据,在ESM-2-650M上该读取方法比分类雅可比方法高9个百分点,N=29、p<0.001,优势在多个架构内复现。消融显示,收益来自带标注的注意力头选择,而非取平均:同一标注预算下,无权重平均与对相同头训练的L1逻辑回归表现相当。两种方法从Zhang的分布内结果到排除数据重叠的划分均下降30—36个百分点,作者将其视为既有结果受预训练重叠影响的上界。作者还提出representation-CJ,将雅可比分析扩展到无掩码语言模型输出头的架构;在两种方法均适用时,每个蛋白质的Pearson相关约0.95。最佳K随模型接触信息在注意力头中的分散程度变化。在测试的两个因果语言模型中,两种方法都无法读取该信号,提示这种残基对结构可能依赖双向预训练。