论文
大语言模型注意力头高阶协同的博弈论自由能分析
A Game Theoretic Free Energy Analysis of Higher Order Synergy in Attention Heads of Large Language Models
摘要
大语言模型依赖于多头注意力,但头之间的交互仍然知之甚少。我们应用博弈论自由能原理(GTFEP):将多智能体系统铸造为分布式变分推理的框架,以将注意力头分析为有界理性智能体。根据 GTFEP 的说法,每个头都最小化其变分自由能,集体行为遵循联盟结构的吉布斯分布,其能量被分解为 Harsanyi 红利。使用易于处理的近似(均匀先验、确定性动力学),联盟自由能减少为离散头输出的联合香农熵(argmax 关键索引)。成对红利成为互信息(非负),而三重红利对应于交互信息并且可以为负。在 BERT、GPT2 和 GSM8K 的 Llama 上,三重红利始终为负,揭示了更高阶的冗余。纳什 FEP 对应关系保证集体自由能的驻点是 epsilon 纳什均衡;因此,贡献可以忽略不计的头可以在性能损失最小的情况下被修剪。修剪具有低边际贡献的头可以降低计算成本,同时将性能损失降至最低:例如,在 GPT2 中修剪 20% 的头可以将 FLOP 减少 18%,将吞吐量增加 22%,并且仅适度增加困惑度(在 GSM8K 上从 28.4 增加到 33.4)。我们的工作表明 GTFEP 为分析和优化Transformer架构提供了原则基础。
