论文
流形引导注意力转向
Manifold-Guided Attention Steering
摘要
尽管拥有正确推理所需的基础知识,大语言模型 在推理任务中经常会产生错误。提高推理一致性的一种可能方法是通过激活引导。然而,现有的激活引导方法应用固定的、预先计算的校正向量,忽略了模型当前沿着其生成轨迹的位置;结果是不分青红皂白的扰动,既破坏了已经正确的步骤,也破坏了错误的步骤。我们提出了流形引导注意力转向(MAGS),一种基于几何观察的轨迹感知推理时间干预:特定注意力头的输出激活在错误点偏离低维正确性流形,并且这种偏差通过后续步骤复合。对于每个识别的注意力头,我们从正确和错误轨迹的对比对中学习一个低维子空间,这些轨迹捕获错误行为偏离正确行为的方向。在推理过程中,我们监视每个头与该流形的接近度,并在偏差超过学习阈值时应用有针对性的投影校正,在错误传播之前将注意力输出引导回正确的子空间。 MAGS 在数学推理(MATH-500、GSM8K)、代码生成(HumanEval、MBPP)和分子生成(SMILES)等基准测试中始终优于无转向基线和静态转向方法,这表明正确性流形是 LLM 注意力几何的一般特征。