论文

BOSCH:LLM 中短上下文注意力头选择的黑盒二元优化

BOSCH: Black-Box Binary Optimization for Short-Context Attention-Head Selection in LLMs

模型架构Transformer

摘要

后训练 大语言模型 (LLM) 的混合通常用滑动窗口注意 (SWA) 代替二次自注意,以减少 KV 缓存使用并改善延迟。现有的混合方案通常是在层级别(例如交织)或通过从本地到全局的静态排名在头级别定义的。层级方案忽略了本地和全局依赖关系是通过同一层内的头进行路由的,而静态头级排名则受到纠缠的影响:头的本地/全局行为在混合后可能会发生变化。我们提出了 BOSCH,用于短上下文头选择的黑盒二元优化,这是一种 无需训练 方法,它将问题表述为大邻域搜索并将其分解为三个子问题:(i)通过小预算黑盒探针进行层重要性检测,(ii)基于这些敏感性的自适应每层 SWA 比率分配,以及(iii)比率桶内的分组头级优化。对 4 个 LLM(参数范围从 1.7B 到 30B)、跨 4 个 SWA 比率的广泛实验表明,BOSCH 始终优于层级启发式方法和 6 种强大的静态头级方法,在较高的 SWA 比率下具有更大的增益。在持续的预训练下,BOSCH 更快地恢复原有的长上下文性能,达到更高的水平。对选定负责人的分析显示,博世在不同的 SWA 比率中存在大量人员流动,强调了针对每个目标比率执行负责人级别选择的重要性,而不是依赖于固定的地区排名。