论文

用于推理时间对齐的梯度引导奖励优化

Gradient-Guided Reward Optimization for Inference-time Alignment

模型推理解码与生成控制

摘要

确保 大语言模型 (LLM) 在分布漂移下的可靠性需要推理时间适应。虽然 Best-of-$N$ 和拒绝采样等推理时间对齐方法被广泛使用,但它们将任务构建为采样密集型、奖励引导的搜索,从而导致两个关键限制:它们的性能受到基本模型的生成质量的限制,并且它们对不完美奖励模型的依赖使它们容易受到 奖励作弊 的影响。为了应对这些挑战,我们引入了梯度引导奖励优化(GGRO),这是一种轻量级推理时间方法,可通过梯度引导在解码过程中执行有针对性的、最少的干预。具体来说,GGRO 监控 词元级 熵,以识别指示漂移或未对准的高不确定性区域。一旦检测到,它就会通过注入助推词元来做出响应,助推词元是使用来自现成奖励模型的梯度信号生成的,以引导生成轨迹,而不仅仅是对样本进行重新排序。实验表明,GGRO 持续改进了安全性、有用性和推理基准的推理时间一致性。它还以最小的计算开销增加了 奖励作弊 的高质量响应的覆盖范围和鲁棒性。代码可在 https://github.com/lhk2004/GGRO 获取。