论文

超越最优猜测:用进化策略提升大语言模型的解空间覆盖

Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies

模型评测模型行为与机制分析

摘要

大语言模型正越来越多地被部署到数学和科学等探索发现领域。通常做法是把问题呈现给模型,并将其答案作为所提出的解。然而,在这一最优猜测之外,可以通过增加测试时计算来增强发现能力。在称为 pass@k 的过程中,允许模型探索解空间并生成多样化的候选解。遗憾的是,通过强化学习(RL)对大语言模型进行后训练的标准方法可能限制 pass@k:模型的输出分布向高奖励输出收窄,导致解覆盖坍缩。替代方案是使用进化策略(ES),这是一种基于种群、无梯度的后训练方法,通过随机扰动直接在权重空间中优化。如本文所示,ES 取得了一致高于 RL 的 pass@k,并产生更宽的输出分布与更大的解覆盖。这种覆盖进而使其能够在标准数学基准等任务上取得更好结果。因此,对于发现类问题以及其他以多样化解覆盖为关键的领域,ES 提供了更好的后训练基础。