论文
用A*后训练学习高效推理
Learning to Reason Efficiently with A* Post-Training
摘要
大语言模型(LLM)的许多应用都需要演绎推理,但模型经常产生错误或冗余的推理步骤。我们将自然语言推理框定为搜索问题,其中最终答案就是有效证明本身,要求推理过程中间推断必须正确。具体而言,我们研究LLM能否在A*搜索——一种保证以最优效率路径到达目标的算法——的引导下学会生成正确且高效的证明。我们探索两种训练技术:在A*执行轨迹上进行监督微调,以及使用A*知情过程奖励模型的强化学习。实证上,我们发现1B至3B规模的Llama-3.2模型从A*后训练中获益巨大,准确率从接近零提升到超越规模大得多的DeepSeek-V3.2。我们的分析揭示了一种权衡:简单的正确性奖励使准确率最大化,而A*知情信号在准确率与效率之间取得平衡。此外,我们发现在更大的搜索空间上,用不完美启发式训练的模型表现出更高的准确率。我们的结果展示了由经典搜索算法原理引导推理的一个有前景的方向。