论文

SinkTrack:大语言模型 的基于注意力接收器的上下文锚定

SinkTrack: Attention Sink based Context Anchoring for Large Language Models

模型推理KV Cache

摘要

大语言模型 (LLM) 患有幻觉和上下文遗忘。先前的研究表明,注意力漂移是这些问题的主要原因,其中 LLM 的焦点转移到新生成的标记上,并远离初始输入上下文。为了解决这个问题,我们利用了 LLM 的一个相关的内在特征:注意力集中——持续将高度注意力分配给序列的第一个标记(即 <BOS>)的趋势。具体来说,我们提出了一种先进的上下文锚定方法 SinkTrack,它将 <BOS> 视为信息锚并将关键上下文特征(例如从输入图像或指令派生的特征)注入其表示中。因此,LLM 在整个生成过程中始终锚定到初始输入上下文。 SinkTrack 是 无需训练,即插即用,并且引入的推理开销可以忽略不计。实验表明,SinkTrack 可以减轻文本任务(例如,使用 Llama3.1-8B-Instruct 的 SQuAD2.0 上 +21.6%)和多模态任务(例如使用 Qwen2.5-VL-7B-Instruct 的 M3CoT 上 +22.8%)任务中的幻觉和上下文遗忘。它在不同架构和规模上的一致收益强调了鲁棒性和通用性。我们还从信息传递的角度分析其底层工作机制。我们的源代码位于 https://github.com/67L1/SinkTrack。