论文
ReTreVal:带有验证的推理树——增强型 LLM 多步骤推理的混合框架
ReTreVal: Reasoning Tree with Validation -- A Hybrid Framework for Enhanced LLM Multi-Step Reasoning
摘要
多步推理仍然是大语言模型 (LLM) 的一个关键挑战,特别是在数学和创意写作等复杂领域。虽然最近的方法(包括 ReAct、Reflexion 和 Self-Refine)通过迭代细化和反思来改进推理,但它们往往缺乏对替代解决方案路径的结构化探索和跨问题的持续学习。我们提出了 ReTreVal(带有验证的推理树),这是一个混合框架,集成了思想树探索、自我完善、基于 LLM 的批判评分和反射记忆,以实现有界且经过验证的多步骤推理。 ReTreVal 根据问题复杂性构建具有自适应深度的结构化推理树,其中每个节点在明确的 LLM 生成的反馈的指导下进行迭代的自我批评和细化。双重验证机制评估每个节点的推理质量、一致性和正确性,同时将成功推理路径和失败模式的见解持续存储在反射内存缓冲区中,从而实现跨问题学习。基于批评的剪枝仅保留每个级别得分最高的前 k 个节点,在控制计算成本的同时保留高质量的解决方案路径。我们使用 Qwen 2.5 7B 作为底层 LLM,针对 500 个数学问题和创意写作任务评估 ReTreVal 与 ReAct、Reflexion 和 Self-Refine,并证明 ReTreVal 通过将结构化探索、批判驱动的细化和跨问题记忆相结合,始终优于现有方法,使其对于需要探索性推理、严格验证和知识迁移的任务特别有效。
