论文
奖励加权无分类器指导作为自回归模型中的政策改进
Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models
摘要
考虑一个自回归模型,它产生输出 x(例如,问题的答案、分子),每个输出都可以通过属性向量 y 来概括(例如,有用性与无害性,或生物利用度与亲脂性)。任意奖励函数 r(y) 编码这些属性之间的权衡。通常,倾斜模型的采样分布以增加奖励是在训练时通过强化学习完成的。然而,如果奖励函数发生变化,重新调整就需要重新训练。在本文中,我们证明了奖励加权无分类器指导(RCFG)可以在这种情况下充当策略改进算子,通过 Q 函数近似倾斜采样分布。我们将 RCFG 应用到分子生成中,证明它可以在测试时优化新颖的奖励函数。最后,我们表明,使用 RCFG 作为教师并提炼到基本策略中作为热启动,可以显着加快标准 RL 的收敛速度。