论文

经过认证的机械可解释性:将单输入结果提升到有界邻域

Certified Mechanistic Interpretability: Lifting Single-Input Findings to Bounded Neighbourhoods

模型评测模型行为与机制分析

摘要

机械可解释性对Transformer电路一次进行一个输入的逆向工程,使得观察到的机制无法保证有界输入邻域。我们通过基于约束多项式区域(CPZ)传播的框架来解决这一差距,该框架将机械可解释性观察结果从单个输入提升到一组有界扰动的经过验证的陈述。三个内部注意力查询(top-$k$ 稳定性、证据质量和注意力熵)被制定为注意力权重单纯形上的易处理程序,并且通过Transformer块的 CPZ 传播被证明可以准确地保留 softmax 单纯形和 LayerNorm 零均值恒等式。递归雅可比区域结构通过线性化输入处的块堆栈来跨层深度扩展相同的证书,并避免每层生成器的增长。我们实例化Transformer注意力的框架;由此产生的证书提供了一种方法来强化单输入检查无法自行解决的机械陈述,并为经验启发法可能产生误导的制度中的下游决策提供信息。