论文

通过回顾来学习计划:训练推理模型的事后诸葛亮层次结构

Learning to Plan by Looking Back: Hindsight Hierarchies for Training Reasoning Models

模型训练模型推理监督微调与指令调优推理策略与问题分解

摘要

我们基于以下观察引入了推理模型的自我改进循环:即使问题的难度超出了模型当前的解决能力,额外提供的解决方案也可能使模型能够在事后提取有用的解决方案想法。我们通过联合训练同一模型来展示以下三种能力来实现这一点:仅根据问题预测解决方案想法,根据问题和已知解决方案对想法进行逆向工程,以及使用提供的想法解决问题。该循环交替使用所提供的解决方案对问题进行逆向工程,并使用这些想法作为所有三种能力联合训练的额外监督。我们给出了我们的方法的形式化说明以及精益定理证明器中交互式定理证明的具体实例;实证评估仍是未来的工作。