论文
OPSDL:同策略 用于长上下文语言模型的自 蒸馏
OPSDL: On-Policy Self-Distillation for Long-Context Language Models
摘要
扩展 大语言模型 (LLM) 的有效上下文长度仍然是现实应用程序的核心挑战。虽然最近的 后训练 方法在长上下文扩展方面取得了进展,但它们要么依赖于高质量的监督数据,要么依赖于稀疏的序列级奖励,导致优化不稳定且低效。我们提出了 OPSDL,一种 同策略 Self-蒸馏 方法,用于增强 LLM 的长上下文功能。与最近其他注入特权信息并依赖模型的上下文学习能力充当教师的自蒸馏方法不同,OPSDL利用模型本身强大的短上下文能力作为自教师来监督其在长上下文场景中的生成。该模型首先生成以完整长上下文为条件的响应,然后自学者在相关提取的短上下文下通过逐点反向 KL 散度提供每个标记的监督信号。这种密集的 词元级 信号鼓励忠实使用相关证据,并减轻由不相关背景引起的幻觉。我们在从 7B 到 32B 参数的一系列模型的长上下文基准上评估 OPSDL。结果显示,在不同的上下文长度下,都有一致且显着的改进,其性能优于 SFT 和 DPO 等标准 后训练 方法,并且具有更高的样本效率。值得注意的是,这些收益是在不降低一般短上下文性能的情况下实现的。这些发现凸显了 OPSDL 作为一种可扩展且稳定的长上下文学习方法的有效性。