论文

Hessian 增强词元归因 (HETA):解释自回归 LLM

Hessian-Enhanced Token Attribution (HETA): Interpreting Autoregressive LLMs

模型评测模型行为与机制分析

摘要

归因方法试图通过量化输入标记对生成输出的贡献来解释语言模型预测。然而,大多数现有技术都是为基于编码器的架构设计的,并且依赖于线性近似,无法捕获仅解码器模型中自回归生成的因果和语义复杂性。为了解决这些限制,我们提出了 Hessian 增强词元归因(HETA),这是一种专为纯​​解码器语言模型量身定制的新型归因框架。 HETA 结合了三个互补的组件:捕获跨层的 token 到 token 影响的语义转换向量、对二阶效应进行建模的基于 Hessian 的敏感度分数,以及衡量 token 被屏蔽时信息丢失的 KL 散度。这种统一的设计产生了上下文感知、因果忠实且基于语义的归因。此外,我们引入了一个精心策划的基准数据集,用于系统地评估生成环境中的归因质量。跨多个模型和数据集的实证评估表明,HETA 在归因 忠实性 和与人类注释的一致性方面始终优于现有方法,为自回归语言模型的可解释性建立了新标准。