论文
当注意力关闭时:LLM如何在多轮交互中丢失线索
When Attention Closes: How LLMs Lose the Thread in Multi-Turn Interaction
摘要
大语言模型能在单轮中遵循复杂指令,但在漫长的多轮交互中,它们常常丢失指令、人设和规则的线索。这种退化已在行为层面被测量,却未得到机制层面的解释。我们提出一种通道转变解释:定义目标的词元通过注意力变得难以获取,而与目标相关的信息可能仍存留于残差表示中。我们提出目标可及率(Goal Accessibility Ratio,GAR),衡量生成的词元对任务定义性目标词元的注意力,并将其与滑动窗口消融和残差流探针相结合。当对指令的注意力关闭时,幸存下来的东西揭示了架构差异。跨架构来看,这一转变产生性质上不同的失效模式:一些模型在注意力趋零时仍保持目标条件化行为,另一些模型尽管残差中存在可解码的目标信息仍然失败,而这种编码出现的层从2到27不等。一项模型内因果消融实验在Mistral中强制关闭注意力通道,使20条事实记忆任务上的召回率从近乎完美跌至11%,并在没有用户压力的情况下将人设约束违例提升到高于对抗压力基线的水平,两种效应都出现在可预测的交叉轮次。线性探针能从残差表示中恢复每个回合的召回结果,在全部四种主要架构上AUC最高达0.99,而输入嵌入仍处于随机水平。跨架构与模型规模,注意力损失与残差可解码性之间的差距可以预测目标条件化行为能否在通道关闭后幸存。我们贡献了GAR这一诊断指标、通道转变框架这一受控的机制性解释,以及窗口化注意力关闭下失效时机的参数化预测。
