论文

多头注意力是一场多人博弈

Multi-Head Attention Is a Multi-Player Game

模型训练监督微调与指令调优

摘要

现代 transformer 注意力内部是多智能体的——各头竞争并协调——但我们却把它当作单一优化器来训练。我们对这一缺口进行形式化:交叉熵训练在各头之间诱导出一个隐式势博弈,梯度下降收敛到纳什均衡,而由于未定价的外部性(冗余、相关误差),其低效可能是无界的。我们的主要结果用 Γ(G) 界定无政府代价(Price of Anarchy),Γ(G) 是刻画权重与梯度耦合的头间交互矩阵的非对角质量。在温和的光滑性假设下,我们证明超额幻觉概率与超额头冗余都随 PoA 增长,把两种不同的失败模式统一到同一机制之下。该界具有规范性:降低 Γ(G) 的正则化可证明收紧 PoA。我们将其实例化为 GAME-LoRA,把 Barlow Twins 去相关与 log-determinant 协调压力相结合。实验验证了理论:Γ(G) 可预测幻觉(p<0.05),自发形成的联盟表现出选择性协调,GAME-LoRA 实现最高18%的幻觉削减(平均8%)且无知识退化——这是忽视博弈结构的方法无法达到的帕累托改进。

多头注意力是一场多人博弈
图1:注意力头在使用博弈感知(game-aware)正则化训练时形成策略性联盟。我们将多头注意力建模为一个多人博弈,其中各头竞争梯度信用,同时相互施加未被定价的外部性(冗余、相关误差)。标准交叉熵训练会找到低效的 Nash 均衡;我们的方法 GAME-LoRA 通过 Pigouvian 税将这些外部性内部化(压缩用 log-determinant,冗余用 Barlow Twins)。图中显示 Qwen2.5-0.5B 第 19 层的头交互矩阵 G∈ℝ^{16×16},按谱双聚类重排。左:GAME-LoRA 之前:各头呈现弥散、无结构的耦合。右:GAME-LoRA 之后:出现清晰的联盟(白色线条),联盟内协调增强、联盟间竞争强化。这种联盟化重组降低了 Price of Anarchy(Theorem 2.2),在五种方法中取得最佳的幻觉性能,同时保留了知识(Table 1)。