论文

当多变少时:语言模型中位置相关的重复效应

When More Becomes Less: Position-Dependent Repetition Effects in Language Models

模型评测模型行为与机制分析

摘要

完形填空式探针会改变目标标记出现的频率,隐含地假设目标的更多副本以相同的方式影响预测,无论读出槽位于何处。我们证明这个假设失败了。我们的双探针设计保持重复目标前缀固定,并且仅改变读出位置:相邻探针将槽紧接在重复块之后;移位的探针将其置于新的句子框架内。相邻重复的行为正如启动直觉所预测的那样:$P(\text{target})$ 随着 $N$ 上升并达到稳定状态。移位的重复会产生倒 U 形:$P(\text{target})$ 上升到早期峰值,然后随着添加更多副本而下降。在我们测试的所有 13 个开放访问编码器和解码器模型中,移位的倒 U 显示每个单词的下降,引导 CI 排除零,并且在 42 个多语言单元格中的 42 个西班牙语、中文、德语和法语中复制。六条件因果消融将影响隔离到精确的词汇重复,而不是长度、通用冗余或语义邻居暴露。框架语用控制排除了读出框架的伪影。在内部,每个目标词元的注意力随着 $N$ 下降,而分配给重复块的总预算在因果 LM 中增长,但在我们探测的屏蔽 LM 中却没有增长。改变重复计数的探头不能将读出位置视为与其测量的位置正交。