论文
代理 OPD:具有可转移相对代理更新的 同策略 蒸馏
Proxy OPD: On-Policy Distillation with Transferable Relative Proxy Update
摘要
后训练 for 大语言模型 通常将策略探索与模型优化结合起来,阻碍了策略探索中高奖励行为的重用。虽然 同策略 蒸馏 通过整合独立优化的专家来缓解这一问题,但其对匹配绝对专家分布的依赖可能会产生次优的监督,特别是当目标模型具有不同的先验或已经超过专家的能力时。为了缓解这个问题,我们引入了代理 OPD (P-OPD),这是一个异步 后训练 框架,它传输奖励引起的策略改进而不是绝对策略分配。 P-OPD 首先通过奖励反馈优化代理策略。然后,它提取代理的初始状态和优化状态之间的相对分布变化,通过目标模型自己的 同策略 轨迹传输这些定向更新,同时保留目标策略作为参考。这种解耦的公式要求代理仅提供有用的改进方向,而不是卓越的绝对能力,从而使来自较旧或较弱代理的更新信号保持高效。对 Qwen3 系列模型在数学推理和代码生成方面的系统实验表明,P-OPD 持续增强了已经很强大的目标模型。此外,可以通过信号缩放动态调节传输强度,使得提取的更新信号可以在不同的模型变体和训练配置中无缝地重复使用。这些结果将相关政策更新确立为可扩展、基于奖励的 后训练 的高度可重用、可调整的资产。