论文
学习压缩上下文模型的优化景观
The Optimization Landscape of Learning Compacted Context Models
摘要
许多作品通过无限的上下文窗口来实现持续学习。由于智能体将更多观察放入上下文(具体来说是 KV 缓存)中,压缩所述上下文类似于直接记忆操作,而不会影响基本模型的权重。许多工作将 KV 压缩作为一个优化问题:学习与完整 KV 缓存的行为相匹配的较小的 KV 向量集。虽然这保留了基本模型的行为,但通过冻结的基本模型进行优化会导致一个非常重要的优化问题,并且损失情况很脆弱且平坦。在本文中,我们描述了导致这些优化问题变得困难的原因,并证明了高度简化的基于感知器的架构不仅与连续上下文压缩中完整感知器变压器的性能相匹配,而且在压缩效用方面优于基线。结果显示了财务、法律、古腾堡和代码领域的 MCQ 任务。
