论文
共振上下文锚定:在推理时解耦注意力路由和信号增益
Resonant Context Anchoring: Decoupling Attention Routing and Signal Gain at Inference Time
摘要
大语言模型(LLM)在面对与其内部参数记忆相冲突的输入证据时经常表现出“上下文忽视”,导致持续的事实幻觉。现有的缓解策略主要依赖于抑制特定的神经元激活或采用计算成本昂贵的对比解码机制,这通常会导致困惑度增加或推理延迟显着增加。为了解决这些限制,我们提出了共振上下文锚定(RCA),这是一种基于残余流信号动力学角度的轻量级推理时间干预方法。 RCA旨在解决外部证据在深度网络传播过程中的信号衰减问题。核心机制涉及自注意力模块内路由逻辑和信息量级的正交解耦。通过利用原始的 pre-softmax 注意力分数作为语义对齐的瞬时度量,我们通过非线性整流构建动态增益场,以选择性地放大与上下文标记相对应的值向量的范数,而不改变注意力概率分布。这种机制有效地提高了残余流混合中输入证据的信噪比(SNR),从而在推理过程中将生成轨迹稳健地锚定到真实上下文。对 Llama-3 模型系列的大量实验表明,RCA 在多个事实一致性和强知识冲突任务中显着改善了上下文 忠实性,有效抑制了参数幻觉。此外,结果证实,作为 无需训练 和计算上可忽略的即插即用模块,RCA 在保持模型的通用语言理解能力的同时,在 忠实性 和流畅性方面实现了帕累托改进。