论文
信息丰富悖论:长情境训练破坏参数化知识
Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge
摘要
大语言模型 越来越多地接受跨越文档、代码存储库和交互历史的长上下文的训练和部署。这种缩放反映了一个隐含的假设,即在更长的上下文中进行训练只会通过让模型接触更丰富的证据来帮助模型。我们通过研究上下文窗口如何塑造模型的学习模式,如何在参数内化和上下文化之间转换来挑战这种观点。我们提出了信息丰富悖论,它假设训练上下文中丰富的相关信息可以减少对信息进行参数编码的动机,从而增加对上下文的依赖。在使用长文档进行预训练时,增加上下文窗口可以改善语言建模、自然语言理解和闭卷 MCQA,但只能达到中间最佳值,此后性能会持续下降。在受监督的 微调 中,与任务相关的训练时上下文通过支持上下文提高了性能,但在测试时上下文缺失或误导时降低了鲁棒性。我们的分析表明,当较长的上下文提供较低复杂性的解决方案时,就会出现这种行为。从机制上讲,信息丰富的上下文训练将梯度压力从通常与参数知识相关的前馈网络转移到注意力模块,而因果干预表明这种转变增加了推理过程中对上下文的依赖。总体而言,这些发现支持信息丰富悖论,并表明向近乎无限的上下文扩展不仅仅是提供更多数据的问题,即使高质量的长上下文数据很丰富。