论文
logits-贡献评分识别非文字检索头
Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads
摘要
在长上下文使用中,大语言模型 经常根据相关上下文范围的含义合成答案,而不是逐字复制粘贴它们。识别哪些注意力头执行这种合成对于解释长上下文模型行为很重要。然而,现有的检测器在结构上错过了这些头:它们奖励那些参与标记与生成的标记相匹配的头,这是一种文字复制标准,捕获头读取的位置,但不捕获它通过其输出值(OV)电路写入的内容,正是进行非文字检索的机制。我们引入了 logits-Contribution Scoring (LOCOS),这是一种写入感知检测器,通过将 OV 电路输出投影到答案词元未嵌入方向上来对每个头进行评分,在单次前向传递中对比针和脱针源位置。在三个模型系列(Qwen3、Gemma-3、OLMo-3.1)中,对 NoLiMa 非文字检索基准上的顶级 LOCOS 头进行均值消除,使得 ROUGE-L 在头数低于之前基于注意力的检测时崩溃;在 Qwen3-8B 上,烧蚀 50 个磁头使 ROUGE-L 从 0.401 降至 0.000,而最强基线仍保留 0.292。所选的头是特定于检索的:参数回忆和算术推理在相同的消融下保持在基线。在 Qwen3-8B 上,相同的消融还将 MuSiQue 从 0.55 下降到 0.08,BABI-Long 从 0.62 下降到 0.20,而随机头控制保持在基线的 0.05 以内。