论文
RP-OPSD:用于多语言推理迁移的推理枢轴引导 同策略 自 蒸馏
RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer
摘要
多语言推理迁移对于将 大语言模型 (LLM) 的推理能力扩展到高资源语言之外至关重要。 同策略 self-蒸馏 (OPSD) 及其变体已成为一种有前途的范例,为学生生成的轨迹提供密集的 词元级 监督,但其目标并未明确优先考虑对跨语言迁移最关键的推理信号。我们的特征是,目标语言推理包括表面文本和推理枢轴的生成,它们是推进或重定向推理过程并塑造后续推理的决策。这促使特权 蒸馏 围绕此类枢轴集中。因此,我们提出 RP-OPSD,推理枢轴引导的 同策略 Self-蒸馏,使用匹配的教师视图(有或没有英语参考解决方案)之间的分布变化作为操作代理来指导特权 蒸馏 和参考锚定。涵盖 17 种语言和多个难度级别的数学推理基准实验表明,我们的方法优于强大的多语言推理基准和 OPSD 变体。进一步分析表明,RP-OPSD 将特权 蒸馏 集中在推理控制和问题条件状态更新词元上,同时降低了主要支持表面实现的词元的权重。我们的代码可在 https://github.com/NJUNLP/RP-OPSD 获取。