论文

语言模型在串行需求下重新分配注意力头活动方面有何不同

How Language Models Differ in Redistributing Attention-Head Activity Under Serial Demand

模型评测模型行为与机制分析

摘要

模型在每一层注意力头上分配活动的方式提供了它如何通过深度路由信息的粗略视图;这如何随着任务而变化是机制解释必须解释的一部分。保持提示长度固定,我们改变任务需要的串行步骤数,并在 17 个开放权重模型的每一层中进行测量,无论活动集中在几个头上还是随着需求的增加而分散到多个头上。两种情况都会发生:在大多数模型中,中深度之前的层会集中活动,而后面的层会分散活动。模型在这种情况发生的地点和强度方面有所不同。例如,从 0.5B 到 7B 的 Qwen2.5 基础模型在每个任务中的分布都比平均模型要少,并且将活动集中在后半部分的部分区域,其中 Llama 模型从 1B 到 8B 和 OLMo-2 分布; Llama-3.1-70B 和 Qwen2.5-72B 之间的对比主要存在,它们具有相同的层数和头数。这些差异是可重现的,并且训练后的模型保留了大部分基本模型的模式。一项消融研究表明,在一项任务中,活动更集中在顶部头部的模型也更多地依赖于这些头部来获取答案。因此,跨层的集中和传播提供了一种通过深度传递信息的方式来比较模型的新方法。代码可在 https://github.com/johnnyjli/serial-demand-heads. 获取