论文
大语言模型 中大规模自动注意力模式发现
Automated Attention Pattern Discovery at Scale in Large Language Models
摘要
大语言模型 通过扩展在一般设置中工作的功能取得了成功。不幸的是,对于可解释性方法来说,情况并非如此。机械可解释性的当前趋势是为受控环境中的特定行为提供精确的解释。这些通常不能概括,或者对于更大规模的研究来说资源过于密集。在这项工作中,我们建议通过利用代码的结构化性质,挖掘 Java 代码数据集中的完成场景来研究 大语言模型 中的重复行为。我们收集注意力头中生成的注意力模式,以证明它们是模型组件全局可解释性的可扩展信号。我们表明视觉模型为大规模分析注意力模式提供了一个有前途的方向。为了证明这一点,我们引入了注意力模式 - 屏蔽自动编码器(AP-MAE),这是一种基于视觉 Transformer 的模型,可以有效地重建屏蔽注意力模式。 StarCoder2 上的实验表明,AP-MAE (i) 以高精度重建被掩盖的注意力模式,(ii) 以最小的退化泛化看不见的模型,(iii) 揭示推理中的重复模式,(iv) 在不访问 真值 的情况下预测一代是否正确,准确度范围从 55% 到 70%,具体取决于任务,以及 (v) 实现有针对性的干预,将准确度提高 13.6%有选择地使用时,但过度使用时会导致塌陷。这些结果将注意力模式建立为可解释的可扩展信号,并证明 AP-MAE 为 大语言模型 的分析和干预提供了可转移的基础。除了其独立价值之外,AP-MAE 还可以作为指导细粒度机械方法的选择程序。我们发布代码和模型以支持未来的大规模可解释性工作。