论文
规模的好坏:上下文夹带如何随模型大小而变化
Better and Worse with Scale: How Contextual Entrainment Diverges with Model Size
摘要
更大的语言模型在处理上下文信息方面同时变得更好和更差——更擅长忽略虚假声明,更擅长忽略不相关的标记。我们通过上下文夹带的第一个缩放定律形式化了这种明显的悖论,即模型倾向于支持出现在上下文中的标记,而不管相关性如何。分析 Cerebras-GPT (111M-13B) 和 Pythia (410M-12B) 模型系列,我们发现夹带遵循可预测的幂律缩放,但根据上下文类型呈现相反的趋势:语义上下文显示夹带随着规模的增加而减少,而非语义上下文显示夹带增加。具体来说,最大的模型对反事实错误信息的抵抗力是最小模型的四倍,但同时复制任意标记的可能性是最小模型的两倍。这些在模型系列中复制的不同趋势表明,语义过滤和机械复制是功能上不同的行为,它们的扩展是相反的——仅扩展并不能解决上下文敏感性,而是重塑它。