论文

基于残差向量的重建作为长上下文回忆,无论上下文窗口大小

Residual Vector-based Reconstruction as Long-Context Recall Regardless of Context Window Size

上下文与知识上下文工程

摘要

大语言模型(LLMs)处理长上下文,包括长文档和长对话,但面临随输入长度线性增长的令牌级内存消耗。尽管模型优化和有损提示压缩被广泛应用,但这些方法仍无法解决超出预训练和大小限制上下文窗口的长上下文回忆问题。本文提出一种长上下文回忆方法,在上下文长度增加时保持近乎恒定的GPU内存使用,且无需额外训练。其核心思想是利用LLM前馈层中的参数激活来重建事实,这些激活存储了表示源文档事实的残差向量。通过使用残差向量,LLM能够确定性地重建与查询相关的事实,而无需参考原始文档,从而保持高保真度并降低内存使用,且无需微调权重。实验结果表明,该方法能够在包含两百万令牌故事的上下文中回答单事实问题,而此前方法在此场景下无法实现。

基于残差向量的重建作为长上下文回忆,无论上下文窗口大小:论文配图
图 1. 两相流中所提出的方法概述。记忆在有界窗口中读取源,提取锚键和值条目,将每个值编码为由模型激活索引的残差δ\delta,并在源被丢弃之前将索引残差向量存储在冻结模型之外。在响应时,问题路由到存储的条目,门控注入在其指定的前馈层添加每个选定的 δ\delta,冻结模型根据重构的事实生成答案。概念流程图。蓝色记忆路径从文档中提取键和值条目,在冻结的语言模型中找到它们的地址激活,对残差向量进行编码,并将索引向量存储在模型外部。绿色响应路径将后面的问题路由到内存,在其前馈层注入选定的残差向量,并返回答案。