论文
Certified Circuits:机制电路的稳定性保证
Certified Circuits: Stability Guarantees for Mechanistic Circuits
摘要
了解神经网络如何得出预测对于调试、审核和部署至关重要。机械可解释性通过识别电路(负责特定行为的最小子网络)来实现这一目标。然而,现有的电路发现方法很脆弱:电路强烈依赖于所选的概念数据集,并且常常无法进行分布外传输,从而引发了人们对它们是否捕获概念或数据集特定工件的怀疑。我们引入了认证电路,它为电路发现提供了可证明的稳定性保证。我们的框架将任何黑盒发现算法与随机数据子采样包装在一起,以证明电路组件包含决策对于概念数据集的有界编辑距离扰动是不变的。不稳定的神经元被放弃,产生更紧凑、更准确的电路。在 ImageNet 和 OOD 数据集上,经过认证的电路的准确度提高了 91%,同时使用的神经元减少了 45%,并且在基线下降的情况下仍然保持可靠。 Certified Circuits 通过提供可证明稳定且更符合目标概念的机械解释,将电路发现置于正式的基础上。代码即将发布!