论文
MAD-OPD:通过多代理辩论打破 同策略 蒸馏 的天花板
MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate
摘要
同策略 蒸馏 (OPD) 在 词元级 教师的监督下按照自己的轨迹训练学生,但现有方法受到单个教师能力上限的限制:当教师犯错时,学生会继承错误。 OPD 在代理任务中也基本上未被探索,其中每步错误在长轨迹上复合并破坏训练的稳定性。我们提出MAD-OPD(多智能体辩论驱动的同策略 蒸馏),它通过将蒸馏教师重新塑造为一个审议学生同策略状态的教师集体来打破这一上限;辩论产生了一种新兴的集体智慧,可以提供 词元级 监督,每位教师的贡献都以其辩论后的信心来衡量。为了将 OPD 扩展到代理任务,我们还引入了 同策略 Agentic 蒸馏 (OPAD),它增加了步级采样以稳定多步错误复合下的训练。我们还推导了任务自适应发散原理,选择JSD(Jensen-Shannon divergence)来实现代理稳定性,并选择反向KL(Kullback-Leibler)发散来生成代码,并在理论上和经验上进行了验证。在六种师生配置(Qwen3 和 Qwen3.5;1.7B-14B 学生,8B-32B 教师)和五种代理和代码基准测试中,MAD-OPD 在所有六种配置中排名第一;在 14B+8B$\to$4B 设置上,与更强的单教师 OPD 相比,它使代理平均值提高了 $+2.4\%$,代码平均值提高了 $+3.7\%$。