论文

真实场景中的对比归因:现实基准上LLM失败的可解释性分析

Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks

模型评测模型行为与机制分析

摘要

可解释性工具正被越来越多地用于分析大语言模型(LLM)的失败,但已有工作大多聚焦于短提示或玩具设定,这些工具在常用基准上的行为尚未得到充分研究。为填补这一空白,我们研究基于LRP的对比归因,将其作为在现实环境中分析LLM失败的实用工具。我们将失败分析形式化为对比归因(contrastive attribution),把错误输出token与正确替代token之间的logit差异归因到输入token与内部模型状态,并引入一种高效扩展,使得能为长上下文输入构建跨层归因图。利用该框架,我们在多个基准上开展了系统的实证研究,比较不同数据集、模型规模与训练检查点下的归因模式。我们的结果表明,这种token级对比归因能在部分失败案例中产生有信息量的信号,但并非普遍适用,凸显了其在现实LLM失败分析中的效用与局限。我们的代码发布于:https://aka.ms/Debug-XAI。

真实场景中的对比归因:现实基准上LLM失败的可解释性分析:论文配图
图 2:输入归因热图示例。 (a) URT:Qwen3-0.6B 低估了指令标记“逗号”。 (b) OIT:Qwen3-0.6B 过度重视不相关的标记“(a”。(c) NC-IA:仅输入归因提供有限的解释,激发归因图分析。颜色强度显示每个token对目标对比度偏好的积极(红色)或消极(蓝色)影响。