论文
通过特定于层的位置嵌入缩放来减轻 Transformer 中的位置偏差
Mitigating Position Bias in Transformers via Layer-Specific Positional Embedding Scaling
摘要
大语言模型 (LLM) 仍然在努力解决“中间丢失”问题,即位于长上下文输入中间的关键信息通常未被充分代表或丢失。虽然现有方法试图通过结合多尺度旋转位置嵌入(RoPE)来解决这个问题,但它们通常会遇到高延迟或依赖于次优的手工缩放策略。为了克服这些限制,我们引入了一种特定于层的位置嵌入缩放(LPES)方法,该方法为每一层分配不同的缩放因子。 LPES 在没有 微调 模型参数或增加推理延迟的情况下实现了更平衡的注意力分布。采用专门设计的遗传算法,通过结合贝塞尔曲线来有效地选择每层的最佳缩放因子,从而显着减少搜索空间。大量实验表明,LPES 有效地减轻了位置注意力偏差,并在多个长上下文基准测试中提供了一致的改进,在键值检索数据集上实现了高达 11.2$\% 的准确度增益。