论文
PAPA:在线个性化主动偏好调整
PAPA: Online Personalized Active Preference Alignment
摘要
扩散模型在对复杂数据分布(包括图像和文本)进行建模时非常有效。然而,在个性化推荐系统等应用中,目标通常转移到对分布的特定区域进行建模,以最大化用户偏好——最初未知,但通过交互式反馈逐渐发现。这自然可以被视为强化学习问题,其目标是微调扩散模型以根据偏好最大化奖励函数。然而,主要的挑战在于学习参数化奖励模型,这通常需要大规模的偏好数据——这在实践中通常是不可行的。在这项工作中,我们引入了个性化主动偏好对齐 PAPA,这是一种通过使用实时用户反馈直接优化扩散模型来绕过参数化奖励模型的要求的新颖方法。 PAPA 从变分推理框架中汲取灵感,实现反馈高效的偏好对齐。我们通过跨不同类条件和细粒度对齐任务的广泛实验和消融研究证明了 PAPA 的有效性。此外,基于理论见解,我们提出了一种增强的 微调 策略,称为 EPAPA,该策略需要更少的计算预算并加速 微调 过程,进一步提高 PAPA 对实际部署的适用性。我们的代码已在 https://github.com/NasikNafi/papa 上公开发布。