论文
组合、重建和纠正预计算内存的成本是多少
What It Costs to Compose, Rebuild, and Correct Precomputed Memory
摘要
语言模型可以从预先计算的内存中进行回答,模型保存了对材料主体的读取,可以在请求之间重复使用,而不是在每个请求中再次读取。本文描绘了这种做法在哪些方面可以保持正确性,以及在什么情况下会失败。在 Llama-3.1-8B-Instruct 上进行的实验中,使用保存的键值缓存和经过训练的压缩,预计算的内存在从单独准备的部件组装时会降级,只有通过在我们的测量中花费大量准备工作的重建才能保持最新状态,并且忽略在措辞条件下提供的更正。如果预先计算的记忆可以彼此并列服务,可以经济有效地重建,并被实时到达的新信息所取代,那么它们可以作为一种避免在重复查询时将上下文重新输入到模型的方法。我们的结果对于处理各种查询的已部署系统的含义是,预计算的内存最好按照新信息改变内存最初计算的内容的节奏来重建。键值缓存的热重建训练压缩和在内存旁边提供特定短语的更新(如粘贴文本或注入缓存状态)都显示出保持预计算内存最新的特殊前景,后者作为重建之间的临时措施,我们测量成本并命名与每个相关的剩余问题。