论文
推理时间奖励对齐中的并行回火初始采样
Parallel Tempering Initial Sampling in Inference-Time Reward Alignment
摘要
推理时间奖励对齐引导预训练的扩散和基于流的生成模型,以满足用户指定的奖励,而无需重新训练。最近,顺序蒙特卡罗 (SMC) 通过迭代过滤和传播多个粒子,成为执行此任务的强大框架。然而,我们表明,基于标准 SMC 的方法通常性能不佳,因为它们从标准先验初始化粒子,而复杂奖励景观中的高奖励区域极其罕见。此外,我们表明,即使是最近的奖励感知初始采样方法仍然容易陷入局部模式,因为复杂的奖励景观通常是多模式的。为了克服这些限制,我们提出了 PATHS(用于高复杂性奖励采样的并行回火),这是一种新颖的初始化方法,通过并行回火耦合多个采样链。 PATHS 维护着一个奖励调节链的阶梯,并定期执行 Metropolis 交换,从而能够在平坦的奖励景观中进行有效的探索,从而减轻模式陷阱问题。我们的分析表明,这种机制大大增强了对通常难以采样的稀有、高回报区域的有限预算探索。布局到图像和数量感知生成的实验表明,PATHS 在对齐质量方面取得了一致的进步,特别是在复杂的提示上。