论文
搜索、失败、恢复:纠正感知推理的训练框架
Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning
摘要
许多推理任务无法用单条从左到右的链良好描述:求解者可能需要追一个看似合理的分支、观察到延迟失败、再返回到仍可完成的最新前缀。我们介绍Pyligent——受Diligent Learner表述启发的训练与推理框架:把推理表示为对部分解链的经验证搜索。任务验证器标注生成的续写与失败,所得搜索树被转为三个动作(继续、完成、回溯)的监督目标,附带总结被放弃分支的可选轨迹。我们在为隔离延迟失败恢复而设计的隐藏有向图任务上评估Pyligent,并在带精确验证器的结构化推理域上评估——包括4×4数独、带推理轨迹的数独与Blocksworld。与仅金标SFT相比:Pyligent在隐藏图上把解题率提升72.7分,混合与专家数独分别提升17与18分,带推理轨迹的混合与专家数独分别提升27与14分,Blocksworld提升13分。结果表明显式的失败分支监督能教出超越模仿精修解链的有用恢复行为。
