论文

FocuSFT:稀释感知长上下文的双层优化 微调

FocuSFT: Bilevel Optimization for Dilution-Aware Long-Context Fine-Tuning

模型训练监督微调与指令调优

摘要

大语言模型 现在可以处理越来越长的输入,但它们有效使用跨长上下文传播的信息的能力仍然有限。我们将这一差距追溯到长序列上的监督 微调 (SFT) 期间注意力预算的支出方式:位置偏差和注意力池导致模型将大部分注意力分配到位置特权标记而不是语义相关的内容。这种训练时注意力稀释(注意力分布中内容标记的匮乏)削弱了梯度信号,限制了模型学习鲁棒的长上下文能力的能力。我们引入了 FocuSFT,这是一个双层优化框架,可以在训练时解决这个问题。内部循环在训练上下文中采用轻量级快速权重参数,以形成参数化记忆,将注意力集中在相关内容上,而外部循环则在此锐化表示的基础上执行 SFT。两个循环都对上下文标记应用双向注意力,同时保留响应的因果屏蔽,减少引起注意力集中的因果不对称性并调整内外行为。在 BABILong 上,FocuSFT 在 4K--32K 上下文长度上将准确度提高了 +14pp;在 RULER 上,它在 16K 时将 CWE 聚合从 72.9\% 提高到 81.1\%;在使用代理工具的 GPQA 上,它在 pass@1 中产生了 24% 的相对增益。注意力分析表明,FocuSFT 将注意力集中量减少了 529$\times$,并将训练期间的情境参与度增加了三倍。代码:https://github.com/JarvisPei/FocuSFT