论文
ReHoPER:增强推理的后退规划
ReHoPER: Receding-Horizon Planning for Enhanced Reasoning
摘要
我们提出了 ReHoPER,这是一种仅推理的零样本方法,它通过在最终答案之前沿多个路径生成和回答中间问题来改进大语言模型的推理。它迭代地规划候选中间问题的范围,选择一个来回答,并根据更新的历史记录重新规划。 ReHoPER 与任务无关,在数据集和模型中使用相同的通用指令,无需标记数据或特定于任务的提示设计。在多个数据集上,包括 iLLC(一种新的组合推理受控基准),ReHoPER 的表现优于强大的基线,在最组合的设置中获得最大收益。我们的实现和 iLLC 生成器是公开可用的,以支持未来的工作。