论文
真实场景中的对比归因:现实基准上LLM失败的可解释性分析
Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks
摘要
可解释性工具正被越来越多地用于分析大语言模型(LLM)的失败,但已有工作大多聚焦于短提示或玩具设定,这些工具在常用基准上的行为尚未得到充分研究。为填补这一空白,我们研究基于LRP的对比归因,将其作为在现实环境中分析LLM失败的实用工具。我们将失败分析形式化为对比归因(contrastive attribution),把错误输出token与正确替代token之间的logit差异归因到输入token与内部模型状态,并引入一种高效扩展,使得能为长上下文输入构建跨层归因图。利用该框架,我们在多个基准上开展了系统的实证研究,比较不同数据集、模型规模与训练检查点下的归因模式。我们的结果表明,这种token级对比归因能在部分失败案例中产生有信息量的信号,但并非普遍适用,凸显了其在现实LLM失败分析中的效用与局限。我们的代码发布于:https://aka.ms/Debug-XAI。
