论文
基于残差向量的重建作为长上下文回忆,无论上下文窗口大小
Residual Vector-based Reconstruction as Long-Context Recall Regardless of Context Window Size
摘要
大语言模型(LLMs)处理长上下文,包括长文档和长对话,但面临随输入长度线性增长的令牌级内存消耗。尽管模型优化和有损提示压缩被广泛应用,但这些方法仍无法解决超出预训练和大小限制上下文窗口的长上下文回忆问题。本文提出一种长上下文回忆方法,在上下文长度增加时保持近乎恒定的GPU内存使用,且无需额外训练。其核心思想是利用LLM前馈层中的参数激活来重建事实,这些激活存储了表示源文档事实的残差向量。通过使用残差向量,LLM能够确定性地重建与查询相关的事实,而无需参考原始文档,从而保持高保真度并降低内存使用,且无需微调权重。实验结果表明,该方法能够在包含两百万令牌故事的上下文中回答单事实问题,而此前方法在此场景下无法实现。
