论文

奖励分数匹配:统一流模型和扩散模型的基于奖励的 微调

Reward Score Matching: Unifying Reward-based Fine-tuning for Flow and Diffusion Models

模型训练偏好优化

摘要

基于奖励的 微调 将预训练的扩散或基于流的生成模型引向更高奖励的样本,同时保持接近预训练的模型。尽管现有的方法是从不同的角度衍生出来的,但我们表明许多方法可以在一个通用框架下编写,我们称之为奖励分数匹配(RSM)。在这种观点下,对齐变成了针对价值引导目标的分数匹配,并且不同方法之间的主要差异减少到价值引导估计器的构造和跨时间步长的有效优化强度。这种统一澄清了现有设计的偏差-方差-计算权衡,并将核心优化组件与辅助机制区分开来,这些辅助机制增加了复杂性,但没有明显的好处。在这个观点的指导下,我们在代表性的可微分和黑盒奖励对齐任务中开发了更简单、更高效的重新设计。总体而言,RSM 将看似分散的基于奖励的 微调 方法集合转变为更小、更可解释且更可操作的设计空间。代码可在 https://github.com/jaylee2000/rsm 获取。