论文

ExpBoN:指数噪声 Best-of-$n$ 实现高效测试时 LLM 对齐

ExpBoN: Exponential-Noise Best-of-$n$ for Efficient Test-Time LLM Alignment

模型推理解码与生成控制

摘要

Best-of-$n$ (BoN) 采样是一种简单而有效的推理时间对齐方法,但硬最大化仅提供对奖励和分配偏移之间权衡的粗略控制。 Soft Best-of-$n$(Verdun et al. 2025)提供更平滑的控制并收敛到与 KL 正则化奖励最大化相关的最优分布。在本文中,我们介绍了 ExpBoN,这是一种基于指数噪声报告噪声最大机制的替代软 BoN 方法。它允许精确的有限 $n$ 分解,从而在总变差、预期奖励和 KL 散度的两个方向上产生指数级快速收敛。我们对其收敛和遗憾行为提供全面的理论分析。我们进一步将 ExpBoN 集成到引导推测推理(GSI)框架(Geuter、Mroueh 和 AlvarezMelis 2025)中,从而产生 ExpGSI,以实现高效的奖励引导 LLM 对齐。 ExpGSI 显着降低了计算成本,同时保持了相当的精度。使用 Qwen2.5-Math 和 Qwen3 模型系列在 MATH500、MMLU-STEM 和 Minerva Math 上进行的实验表明,对于 Qwen2.5-Math 的候选预算,ExpGSI 将估计计算量减少了 $14\%$-$39\%$,对于 Qwen3,在 $n=16$ 时最多减少了 $45\%$。总的来说,我们的结果为指数噪声 BoN 和高效的测试时 LLM 对齐提供了理论和算法基础。