论文

什么时候两个网络相同?机械可解释性的张量相似性

When Are Two Networks the Same? Tensor Similarity for Mechanistic Interpretability

模型评测模型行为与机制分析

摘要

机械可解释性旨在将模型分解为有意义的部分;验证两个这样的部分是否实现相同的计算是先决条件。现有的相似性度量要么评估经验行为,使它们对分布外机制视而不见,要么评估依赖于基础的参数,这意味着它们忽略权重空间对称性。为了解决基于张量的模型类的这些问题,我们引入了一种基于权重的度量,即张量相似度,它对于这种对称性是不变的。该指标捕获全局功能等价性,并使用高效的递归算法解释跨层机制。根据经验,张量相似度跟踪功能训练动态,例如 grokking 和后门插入,比现有指标具有更高的保真度。这减少了测量相似性并将 忠实性 验证为已解决的代数问题,而不是经验近似问题。