论文

Flux-OPD:具有不断变化的上下文的 同策略 蒸馏

Flux-OPD: On-Policy Distillation with Evolving Contexts

摘要

大语言模型 开放领域的训练缺乏可验证的奖励,使得任务偏好难以形式化为有效的监督。背景可以传达这种偏好,但一旦提炼到学生身上,就几乎无法提供额外的监督,从而激励背景随学生的表现而变化。然而,直接使用不断变化的上下文作为训练中的监督会导致不稳定的 蒸馏 目标和冲突的分布,需要稳定目标和减轻冲突的机制。在本文中,我们通过分解反向 KL 目标来分析情境的影响,揭示了两个发现:学生被提炼为情境条件教师的几何平均值,并且目标包含一个衡量这些教师之间冲突的冲突项。基于这种分解,我们提出了 Flux-OPD,这是一种 OPD 范式,它使用不断发展的上下文作为训练中的监督来捕获开放领域中的任务偏好。 Flux-OPD将上下文条件教师和上下文无关教师之间的差异视为上下文差异信号,将它们作为上下文校正注入上下文无关教师锚中,并使用冲突项作为指标来衡量其校正强度。开放式任务的实验表明,Flux-OPD 优于现有的 OPD 范式,凸显了将教师监督与不断变化的环境相结合的潜力。