论文

通过平滑切比雪夫标量化实现帕累托最优离线强化学习

Pareto-Optimal Offline Reinforcement Learning via Smooth Tchebycheff Scalarization

模型训练偏好优化

摘要

大语言模型 可以通过小型标记数据集上的离线强化学习 (RL) 来符合人类偏好。虽然单目标对齐已得到充分研究,但许多现实世界的应用程序需要同时优化多个相互冲突的奖励,例如蛋白质的活性和特异性,或者聊天机器人的有益性和无害性。先前的工作很大程度上依赖于线性奖励标量化,这可能无法恢复帕累托前沿的非凸区域。在本文中,我们没有直接对奖励进行标量化,而是将多目标强化学习本身构建为一个优化问题,通过平滑的切比雪夫标量化进行标量化,这是一种克服线性标量化缺点的最新技术。我们使用这个公式推导出多目标偏好的平滑切比雪夫优化 (STOMP),这是一种新颖的离线 RL 算法,通过根据观察到的分布标准化个体奖励,以原则性的方式将直接偏好优化扩展到多目标设置。我们在 3 个蛋白质工程和 3 个聊天机器人比对数据集上使用多个基本模型对 STOMP 进行实证验证。与最先进的基线相比,STOMP 在 16/18 蛋白质任务和 5/6 自然语言任务上实现或并列最高超容量。因此,我们证明 STOMP 是一种强大、稳健的多目标对齐算法,可以在多个领域有意义地改进 后训练。