论文

IG-Lens:通过伸缩积分梯度实现 Transformer 层上的精确加性概率归因

IG-Lens: Exact Additive Probability Attribution Across Transformer Layers via Telescoping Integrated Gradients

模型评测模型行为与机制分析

摘要

我们问一个关于仅解码器 Transformer 的简单问题:哪两层之间实际产生预测词元的概率?现有的逐层读出工具只能近似回答。 logits 透镜及其经过训练的变体报告每层概率级别,但不提供加法分解;他们的估计在深度上是有偏差且非单调的。直接logits归因和相关的残差流方法是可加性的,但只有在logits空间中,softmax非线性打破了概率空间中的可加性,这正是人们通常关心的量。层电导对每层的梯度进行积分,但将每个梯度归因于其自己的基线,因此不会总计为预测的总变化。我们介绍 IG-Lens,这是一种积分梯度的伸缩应用程序,沿着从基线到最终层的隐藏状态的单一路径。将每个段归功于它终止的层会产生分层归因,其总和恰好是目标概率的变化,其中 softmax 在积分路径内而不是线性化。我们的默认估计器将每个积分步骤归功于其观察到的目标概率变化(本着 IDGI 精神的预测感知重新加权),而不是其原始梯度。因为读数是一维概率,所以这会将每个段折叠为端点值的伸缩总和,因此在任何步数上完整性都精确地保持(到浮点),消除黎曼离散化误差,同时抑制显示梯度敏感性的步骤,而不改变输出。我们给出了伸缩身份及其证明,验证了浮点的完整性,并描述了一个单遍批量实现,无需任何向后调用即可计算完整的逐层词元映射。代码:https://github.com/anhnda/IGLens。