论文
重复词元计数揭示了表示和输出之间的分离
Repeated-Token Counting Reveals a Dissociation Between Representations and Outputs
摘要
大语言模型 无法计算单词在列表中重复的次数,尽管它们在更难的推理任务中表现良好。这些失败通常归因于内部计数跟踪的限制。我们证明这种归因是错误的。残余流上的线性探针在每个嵌入后层以近乎完美的精度解码正确的计数,即使在输出中出现错误答案的确切层也是如此。注意力模式没有显示出重复标记导致崩溃的证据,并且标记化工件不能解释任何失败。相反,大约 85--93\% 网络深度的多层感知器 (MLP) 块会用固定的错误答案覆盖正确编码的计数。消除这个块会改变错误的输出,并确定它对失败负有因果责任。该块在空格分隔的重复单词格式上触发,并且对于重复数字标记不存在。该模式在 Llama-3.2(1B 和 3B)和 Qwen2.5(1.5B、3B 和 7B)中保持一致的相对深度。计数被正确表示,并且特定的计算阻止其到达输出,因此表示失败和路由失败需要不同的干预。