论文

学习压缩上下文模型的优化景观

The Optimization Landscape of Learning Compacted Context Models

模型推理KV Cache

摘要

许多作品通过无限的上下文窗口来实现持续学习。由于智能体将更多观察放入上下文(具体来说是 KV 缓存)中,压缩所述上下文类似于直接记忆操作,而不会影响基本模型的权重。许多工作将 KV 压缩作为一个优化问题:学习与完整 KV 缓存的行为相匹配的较小的 KV 向量集。虽然这保留了基本模型的行为,但通过冻结的基本模型进行优化会导致一个非常重要的优化问题,并且损失情况很脆弱且平坦。在本文中,我们描述了导致这些优化问题变得困难的原因,并证明了高度简化的基于感知器的架构不仅与连续上下文压缩中完整感知器变压器的性能相匹配,而且在压缩效用方面优于基线。结果显示了财务、法律、古腾堡和代码领域的 MCQ 任务。

学习压缩上下文模型的优化景观的原论文方法或结果图
图 20:左 (a):31 次应用后的循环线性映射 KL,紧接着训练的 7 次应用。 0%、20%、40% 和 50% 的身份密钥分数给出的 KL 值为 2.01、1.23、1.17 和 1.17。右 (b):循环架构简化。删除第二个块和 self-attention 并固定输出读出提高准确性;直接查询和去除交叉注意力残差可以带来进一步的收益。结果使用相同的 200 个问题评估。