论文

同策略 Delta 蒸馏 用于多语言数学推理

On-Policy Delta Distillation for Multilingual Math Reasoning

摘要

同策略 蒸馏 (OPD) 正在成为 LLM 后训练 强化学习的有前途的替代方案,但其在多语言环境中的有效性仍未得到充分探索。我们研究 OPD 及其高级变体 同策略 Delta 蒸馏 (OPD$^2$),用于英语、韩语和日语的数学推理。 OPD$^2$ 通过使用训练后的教师与其基础模型之间的概率差距作为学习信号来改进 OPD。 Qwen3 的实验表明,OPD$^2$ 始终优于原始 OPD,在韩语和日语方面的改进尤其显着,并且总体上缩小了英语和韩语的性能差距。我们进一步发现,纯英语 OPD 也可以提高韩语和日语的表现,但通常会将反应转向英语,这凸显了多语言数据对于保留目标语言反应的重要性。