论文

ReTeach:通过多轮反思和重试构建自教师

ReTeach: Building a Self-Teacher through Multi-Round Reflection and Retry

模型优化模型推理推理验证与自校正蒸馏

摘要

自我蒸馏可以提高推理能力,无需单独训练、更有能力的老师,但其有效性取决于自学教师如何获得相对于学生的优势。让教师参考参考答案或解决方案可以提供这样的优势,但这些信息可能无法获得。反思提供了一种从自我生成的尝试中得出明确的错误诊断和修订指导的方法,但现有的基于反思的方法通常将其与参考信息、丰富的任务反馈或持久记忆结合起来。我们引入了 ReTeach,一个反射式自我蒸馏框架,它通过多轮反射和仅使用自我生成的尝试和结果级验证的重试来构建其自我教师。从不成功的学生展示开始,教师交替进行明确的反思和重新尝试,直到成功或重试预算耗尽,而无需参考答案或解决方案、外部诊断反馈或交叉示例记忆。每次失败的重试都会通知后续的反思,而成功的纠正则提供 结果级证据表明由此产生的教师环境的潜在效用。结果感知的选择和加权策略区分最初正确的、经过反射校正的和未解决的示例,为它们的类别归一化蒸馏损失分配单独的权重。通过在策略蒸馏,学生将教师的上下文条件标记级预测分布与其自己的推出前缀进行匹配,从而在保留单遍推理的同时传递迭代校正的好处。在数学推理、科学问答和工具使用等六个基准测试中,ReTeach 的平均准确度比 GRPO 提高了 1.39 个百分点。