论文
自回归蛋白质语言模型中的电路追踪
Circuit Tracing in Autoregressive Protein Language Models
摘要
蛋白质语言模型(pLM)可以生成新的蛋白质序列,其特性超出了在自然界中观察到的特性,但蛋白质生成的机制仍然知之甚少。现有的基于稀疏自动编码器和转码器的机械可解释性方法主要关注蛋白质表示学习模型,并且不捕获自回归生成所需的计算。在这里,我们介绍 ProGenMech,这是一种用于生成蛋白质语言模型的机械可解释性框架,它将跨层转码器 (CLT) 扩展到 ProGen3,这是一种经过训练的稀疏专家混合模型,用于因果生成和跨度填充。与每层方法不同,CLT 使用所有先前层的稀疏潜在变量重建每一层,从而能够忠实地恢复层间生成计算。我们进一步开发了一个零样本电路发现框架,以识别负责蛋白质生成和适应度预测的稀疏潜在电路。在因果生成和零样本适应度估计任务中,ProGenMech 在恢复 ProGen3 的概率分布和功能评分行为方面优于本地转码器基线,同时在跨度填充任务中匹配原始模型的生成分布。此外,恢复的电路揭示了与保守序列模式和蛋白质适应性景观相关的具有生物学意义的基序和功能区域,为可解释和可操纵的蛋白质生成奠定了基础。