论文

学习如何忘记:微调 用于长上下文稀疏注意力

Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

模型训练参数高效训练

摘要

之前的许多工作通过稀疏注意力来解决键值 (KV) 缓存选择和压缩问题,以便在没有过多硬件预算的情况下实现 Transformer 语言模型的长上下文推理。我们为具有稀疏注意力的 微调 模型提供了一种新方法。它适用于任何 KV 缓存策略,在适度的硬件预算上运行(例如,具有 40 GB RAM 的单个 Nvidia A100 GPU),并允许模型与策略共同适应,通常优于经过精确注意(序列并行性)训练的模型。我们还通过专用的缩放点积注意力内核支持,提供了 H2O 稀疏注意力(我们实验中的领先策略)的有效实现。 KeysAndValues (https://github.com/awslabs/keys_values) 是一个用于长上下文推理和 微调 的新开源库,为此处讨论的所有方法提供易于使用且高性能的代码。