论文
哪些注意力头类似于人类头部?不是那些会计算的人
Which Attention Heads are like the Human Head? Not the Ones that Compute
摘要
大脑与人工智能的一致性通常被解释为模型和大脑执行类似计算的标志。很少检查对齐的单元是否因果性地参与模型计算。在抽象模式完成任务(AAABAAA $\rightarrow$ B)上,我们将 LLM 注意力头表示与人类脑电图进行比较,并测试消融这些头如何影响任务表现。对齐和因果关系分离:大脑对齐的头部有助于表现,但删除它们的破坏性比通过归因修补选择的头部的删除要小得多。我们比较了先前的可解释性工作在不参考大脑的情况下定义的两个头集:概念向量(CV),它代表跨格式的抽象模式,以及函数向量(FV),因为它们对正确答案预测的贡献而被选择。大脑排列与 FV 分数几乎没有关联,而它与 CV 分数的关联因模型而异。在大脑对齐的头部中,我们发现了重复的注意力特征:一个强调独特的元素(新奇的头部),另一个强调重复的元素(重复的头部)。新奇的家族追踪显着性并关注人类所关注的相同元素,但平均而言,其删除比随机消融的破坏性更小。重复头对性能贡献不大,并且与抽象模式表示(CV)相关。在跨越 3B-72B 参数的 17 个模型中,FV 排序的删除比大脑排序的删除更具破坏性。因此,大脑对齐捕获了模型如何读取刺激,并且仅微弱地捕获了它如何表示模式并解决任务。