论文
LLM中扩展搜索空间上的类优化逐步推理
Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces
摘要
可验证的奖励训练改进了数学和编码推理,但这些领域仅捕获了逐步决策的一部分。许多现实世界的任务需要在许多有效的替代方案中找到一个高价值的可行计划。我们引入了 OPT*,这是一个可扩展的优化式任务系列,用于沿着复杂性轴训练和评估 LLM 逐步优化式推理:每个任务提供可行性检查器和评估器,而复杂性参数扩展搜索空间,而不需要新的人工标签。这促使我们以两种方式研究这些任务:(i)求解器引导的在线策略优化,它使用求解器作为部分状态的价值预言机,并应用基于排名的奖励塑造来加强更好的后续步骤,以及(ii)当此类求解器不可用时,基于搜索的离线强化学习。理论上,我们将大型搜索空间中的成功与推理机每单位搜索预算提取的信息联系起来。根据经验,我们消除了在 OPT* 上提高搜索效率的因素,并表明 OPT* 上的训练可以改善逐步优化的推理。
