论文
Best-of-Better-$N$:通过上下文学习生成预先对齐的响应
Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning
摘要
推理时间对齐方法(例如 Best-of-$N$)通过使用奖励模型来选择由参考 LLM 生成的高质量响应,为基于训练的对齐提供了灵活的替代方案。然而,这些方法的功效本质上受到响应质量的限制:如果参考 LLM 为高奖励响应分配的概率可以忽略不计,则任何选择策略都不会成功找到一致的输出。在这项工作中,我们提出了 Best-of-Better-$N$ (BoBN),这是一个基于上下文学习的生成框架来应对这一挑战。我们的方法利用与输入查询和任务相关的高回报示例进行检索。至关重要的是,我们引入了一个重新设计步骤,其中检索到的响应由参考 LLM 重写,以与目标任务的格式和风格保持一致。这些重新设计的示例在上下文中使用,将抽样分布转向高回报区域。我们分析描述了上下文学习如何将预训练的 Transformer 的输出分布转向高奖励区域,从而为目标任务带来可证明的好处。然后,我们通过多个参考 LLM 评估 BoBN 的安全对齐和数学推理基准。当响应数量 $N$ 固定并且实现目标性能所需的 $N$ 较小时,BoBN 的更高质量响应可以实现更好的性能。