论文

使用Harness进行训练:同策略 Harness Self-蒸馏 用于复杂推理

Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning

摘要

推理时间利用大大提高了 大语言模型 在复杂推理任务上的性能。然而,通过添加这些外部工作流程,底层模型的内在功能保持不变。为了弥补这一差距,我们引入了 \emph{同策略 Harness Self-蒸馏} (OPHSD),它采用Harness增强电流模型作为 self-蒸馏 的教师,从而从训练数据之外引入来自Harness的额外监督信号。 OPHSD 将特定于任务的控制功能内化到学生模型中,从而在不同的推理任务中产生强大的通用性和强大的独立性能。通过草稿评估——验证文本分类和计划的利用——解决数学推理任务,OPHSD 始终优于强大的基线(例如,在 HMMT25 上比 OPSD +10.83%)。我们的分析进一步表明,在推理过程中重新连接Harness不会产生额外的好处,甚至会降低性能,这表明复杂的Harness不一定总是永久固定装置;相反,它们可以充当临时训练支架,其好处将永久反馈到基础模型中。我们的代码和训练数据可在 https://github.com/zzy1127/OPHSD-同策略-Harness-Self-蒸馏 上获取。