论文
将语言模型中的流稳定性与长期召回分开
Separating Stream Stability from Long-Term Recall in Language Models
摘要
流语言模型的方法经常与长上下文和记忆系统一起讨论,尽管它们解决不同的问题。注意力接收器可以在无限长的流上稳定自回归生成,而模型仍然无法使用已离开其最近词元缓存的内容。我们认为这种区别应该在系统声明和评估中明确。我们引入三个范围:稳定范围,在该范围内预测行为仍然表现良好;访问范围,过去的内容仍然会对输出产生因果影响;以及实用范围,在该范围内任务保持可接受的性能。我们建设性地证明,稳定范围可以是无限的,而访问和效用范围是有限的。然后,我们提出了 ThreeH,这是一种评估合约,可在共同状态和计算预算下测量所有三个视野。将框架应用于注意力接收流,阐明了其强度、恒定记忆、稳定生成,而不将锚标记视为语义记忆。该框架公开了缓存策略、循环状态、检索和外部存储器的角色。对 128K 词元流、延迟绑定召回和延迟决策的实验表明,注意力池保留本地建模,但不保留活动缓存之外的内容;循环和检索状态扩展了语义范围。