论文

通过双向进化搜索自我改进语言模型

Self-Improving Language Models with Bidirectional Evolutionary Search

模型推理推理搜索与路径规划

摘要

搜索已被提出作为自我改进语言模型和代理系统的有效方法,无论是用于 后训练 样本生成还是推理。然而,广泛使用的方法(例如最佳 N 采样和树搜索)面临两个基本限制:它们由稀疏验证信号引导,并且主要通过自回归扩展构建候选,将探索限制在具有大量模型概率质量的区域。为了解决这些问题,我们提出了双向进化搜索(BES),这是一种将前向候选进化与后向目标分解结合起来的搜索框架。在前向搜索中,BES 通过进化算子增强了标准扩展,这些算子重新组合部分轨迹以生成难以从单个模型轨迹采样中获得的候选者。在后向搜索中,BES 递归地将原始任务分解为可检查的子目标,产生指导前向搜索的密集中间反馈。我们提供的理论动机表明,仅扩展搜索生成的候选者被限制在狭窄的熵壳内,而进化算子可以逃脱它,并且向后搜索可以成倍地减少找到正确答案所需的样本数量。实验表明,在主流 后训练 算法无法改进的具有挑战性的 后训练 任务上,BES 能够实现一致的增益,并且在推理时的三个开放问题解决基准上,BES 在平均和最佳情况性能方面都优于现有的开源框架。代码和训练模型可在 https://github.com/Embodied-Minds-Lab/BES 获取。