论文
质量采样:通过顺序蒙特卡罗进行 无需训练 奖励引导的 LLM 解码
Sampling for Quality: Training-Free Reward-Guided LLM Decoding via Sequential Monte Carlo
摘要
我们在 大语言模型 中引入了奖励引导解码的原则性概率框架,解决了优化 词元级 似然性而不是序列级质量的标准解码方法的局限性。我们的方法通过将模型转换概率与依赖于前缀的奖励潜力相结合,定义了完整序列上的奖励增强目标分布。重要的是,该方法是 无需训练:它保持模型权重不变,而是通过奖励潜力修改推理分布,所有收益纯粹来自推理时间采样。为了从该分布中进行采样,我们开发了顺序蒙特卡罗算法,包括计算效率高的仅前缀变体和前瞻变体,其中间目标与完整序列分布的精确边缘匹配。该框架还将重采样移动更新与 Metropolis-Hastings 更新相集成,并支持分块生成,包含常见的解码策略,例如温度采样和功率调节目标。三个 7B 模型的实证结果显示出显着的收益。在代码生成 (HumanEval) 方面,我们的方法将基本性能提高了 54.9%,并超过了最强的采样基线 9.1%-15.3%。在数学推理(MATH500)上,它取得了高达 8.8% 的提升。值得注意的是,Qwen2.5-7B 在 HumanEval 上达到 87.8%,在 MATH500 上达到 78.4%,始终优于强化学习方法 GRPO。