论文

不太难,也不太容易:从中间状态学习 LLM 结构化推理

Not Too Hard, Not Too Easy: Learning from Intermediate States for LLM Structured Reasoning

模型训练监督微调与指令调优

摘要

有效学习的一个共同原则是练习既不是已经掌握的材料,也不是太难而无法取得进步的材料。我们询问如何将这一原理应用于结构化推理任务,例如数独和迷宫求解。在这些任务中,模型可以反复修改不完整或不正确的候选解决方案,直到满足问题的约束。沿着这条轨迹的中间候选解决方案提供了自然的训练示例:有些已经解决,有些还无法通过模型修复,而另一些则处于当前可实现进展的前沿。因此,我们研究预训练的语言模型是否可以学习修改这些状态​​,以及对该前沿状态的训练是否可以更广泛地改善推理。为了实现这一目标,我们将预训练的语言模型主干与循环更新器结合起来,该更新器在每个更新步骤使用相同的参数反复修改显式解决方案状态。我们进一步引入了使用自我轨迹的前沿导向管理(FOCUS),它从当前模型生成的轨迹中选择训练状态。 FOCUS 衡量模型在固定数量的定期更新内对每个状态的改进程度,并优先考虑可以取得实质性进展的状态。借助 Qwen3-1.7B,FOCUS 在 Sudoku-Extreme 上实现了 64.4% 的精确求解精度,在 Maze-Hard 上实现了 91.1% 的精确求解精度,在跨越 1.7B 至 8B 参数的五个 Qwen 和 Llama 主干上观察到了类似的增益。我们进一步观察了改编后的 LLM 到数学推理和代码执行的零样本迁移,即使循环更新器被禁用并且没有执行下游微调。