论文

抽样推理:在决策点进行切割

Reasoning with Sampling: Cutting at Decision Points

模型推理推理搜索与路径规划

摘要

前沿推理模型是由 后训练 基础语言模型和强化学习产生的。最近的工作对此提出了挑战,表明从基本模型分布的锐化版本(即所谓的幂分布)中进行采样,无需额外的训练、策划的数据集或验证器即可引发类似的推理。然而,要使这种方法实用,需要从功率分布中进行有效采样。采样器需要“混合”功率分布,这需要在目标分布模式之间移动;直观地,例如尝试不同的推理策略。先前工作中提出的采样器在当前推理轨迹中随机均匀地重复选择“剪切”位置,并从该位置开始对后缀进行重新采样。然而,推理轨迹通常包含一些后续决策(例如,证明策略或算法的选择),并且我们观察到统一选择的剪切倾向于重写局部细节而不是重新访问决策点。我们引入了一种算法(Entropy-Cut Metropolis-Hastings),该算法使用基本模型的下一个词元熵作为代理来识别关键决策点并从这些位置重新采样。我们凭经验验证熵跳跃是决策点的有用代理,并且在程式化的推理模型中证明我们的方法的混合时间尺度与跟踪中的决策数量而不是词元数量有关,词元数量可能要大得多。在 MATH500、HumanEval、GPQA Diamond 和 AIME26 中,我们的方法持续改进基线和 RL 训练模型,包括同一 词元预算 的 N 最佳模型。