论文

搜索、失败、恢复:纠正感知推理的训练框架

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning

模型训练监督微调与指令调优

摘要

许多推理任务无法用单条从左到右的链良好描述:求解者可能需要追一个看似合理的分支、观察到延迟失败、再返回到仍可完成的最新前缀。我们介绍Pyligent——受Diligent Learner表述启发的训练与推理框架:把推理表示为对部分解链的经验证搜索。任务验证器标注生成的续写与失败,所得搜索树被转为三个动作(继续、完成、回溯)的监督目标,附带总结被放弃分支的可选轨迹。我们在为隔离延迟失败恢复而设计的隐藏有向图任务上评估Pyligent,并在带精确验证器的结构化推理域上评估——包括4×4数独、带推理轨迹的数独与Blocksworld。与仅金标SFT相比:Pyligent在隐藏图上把解题率提升72.7分,混合与专家数独分别提升17与18分,带推理轨迹的混合与专家数独分别提升27与14分,Blocksworld提升13分。结果表明显式的失败分支监督能教出超越模仿精修解链的有用恢复行为。

搜索、失败、恢复:纠正感知推理的训练框架:论文配图
图 4:使用 Qwen3-4B 在混合数据集上进行数独 4×44{\times}4 消融,报告为三次运行的平均值 ±\pm 标准差。 “无痕迹”使用没有痕迹的架构和一个失败路径时期。 “Traces”使用具有跟踪和一个失败路径纪元的架构,与表 2 中的第一行设置匹配。“更多失败路径纪元”使用跟踪和三个失败路径纪元。