论文

VFUSE:使用稀疏自动编码器理解恶意特征

VFUSE: Virulent Feature Understanding with Sparse autoEncoders

模型评测模型行为与机制分析

摘要

生成模型在蛋白质设计等多个领域取得了显着进展,但这种能力使得危险蛋白质的生成变得不透明。在这项工作中,我们介绍了 VFUSE(使用稀疏自动编码器的有毒特征理解),这是一种机械可解释性方法,可在扩散 Transformer 激活上训练 SAE,以审核蛋白质模型的危险感知特征。我们将 VFUSE 应用于 RoseTTAFold3 和 RFDiffusion3,这是用于蛋白质折叠和合成的流行开放权重模型。我们发现,对于某些模块,当线性探针适合 SAE 潜在空间时,其检测危险设计的能力明显优于原始模型的表示:在不牺牲模型性能的情况下提高可解释性。此外,我们从 SAE 中识别出单语义特征,这些特征仅在 AUROC $0.84$ ($q < 10^{-13}$) 以内的危险设计上触发。据我们所知,这是第一个基于全原子扩散模型训练的 SAE,也是第一个蛋白质设计模型的特征级毒力审核,为安全和可解释的蛋白质设计铺平了道路。