论文
通过自动分段和块 蒸馏 实现块注意力的泛化
Towards Generalization of Block Attention via Automatic Segmentation and Block Distillation
摘要
块注意力将输入作为无法相互关注的单独块进行处理,为改善长上下文场景(例如检索增强生成(RAG))中的 KV 缓存重用提供了巨大的潜力。然而,其更广泛的应用受到两个关键挑战的阻碍:将输入文本分割成有意义的、独立的块的难度,以及现有块 微调 方法的低效率,可能会降低性能。为了解决这些问题,我们首先构建 SemanticSeg,这是一个大型且多样化的语义分割数据集,包含 16 个类别的超过 30k 个实例,包括书籍、代码、网络文本和文本长度范围从 2k 到 32k 的对话。使用该数据集,我们训练一个轻量级分割器,以将文本自动划分为具有可控粒度的人类本能对齐的块。其次,我们提出了块 蒸馏,这是一种比块 微调 更高效的训练框架,它使用冻结的全注意力教师模型来指导块注意力学生。该框架集成了三个新颖的组件:用于减轻块边界信息丢失的块接收器词元、用于利用来自所有块的训练信号的块丢失权重以及用于集中学习块注意力敏感词元的 词元级 损失权重。跨多个模型和基准的实验表明,我们的分段器优于启发式和统计基线,并且块 蒸馏 在块注意力下实现了接近全注意力的性能,为部署块注意力建立了实用且可扩展的途径。