论文

超越重复采样:学习 LLM 推理的搜索策略

Beyond Repeated Sampling: Learning Search Policies for LLM Reasoning

模型训练强化学习

摘要

大型语言模型越来越多地通过花费更多的测试时间计算来解决硬推理问题,但主导策略仍然是幼稚的重复采样:得出许多独立的解决方案,并希望其中一个是正确的。因为这种采样仅通过本地解码噪声进行探索,所以它往往会产生许多接近重复的尝试,而不是真正不同的想法。我们询问是否可以通过首先对问题特定概念、提示或策略进行采样,然后根据它们来生成答案,从而在语义层面上进行探索。我们将其改进为一个简单的、更具探索性的程序,该程序在单个轨迹中发出许多不同的概念,并针对重复采样遇到困难的难题对其进行评估。然后,我们更进一步,使概念生成可训练:通过强化学习来优化小型概念生成器,使其概念最大化更大的、冻结答案生成器的下游成功。在困难的数学推理问题上,经过训练的概念生成器大大提高了答案生成器的 pass@k 性能,优于在相同答案生成分配下的简单重复采样,超越了从更大的未调整模型中得出的概念,并转移到从未针对它进行过训练的答案生成器,包括来自不同系列的模型。因此,一个小模型可以被训练成一种有效的、可重用的搜索策略,用于更大的模型。