论文
图推理中 LLM 注意力机制的形式化和减轻结构扭曲
Formalizing and Mitigating Structural Distortion in LLM Attention for Graph Reasoning
摘要
大语言模型 (LLM) 已显示出对文本属性图 (TAG) 进行推理的前景。然而,将 LLM 应用于图需要将其结构线性化为序列,从而引入源于图带宽问题的失真。虽然这种扭曲已被证明会降低性能,但它通常归因于即时设计或模型规模,从而使潜在机制不清楚。在这项工作中,我们展示了旋转位置嵌入如何将图线性化转变为带宽相关的注意力衰减,从而抑制在序列化序列中被迫远离的图相邻节点之间的注意力。这将基于 LLM 的图形推理的重点从即时工程和扩展转向纠正注意力错位。受此分析的启发,我们提出 \textbf{G}raph-\textbf{a}ligned \textbf{L}anguage \textbf{A}ttention (\textbf{GaLA}),这是对 LLM 的轻量级推理时间修改。 GaLA 将注意力偏向图相邻节点,同时保留 LLM 的顺序归纳偏差。在 TAG 基准测试中,GaLA 以可忽略不计的开销提高了性能,证明失真是基于 LLM 的图形推理中的可纠正瓶颈。