论文
更好的鞭策应从每个目标开始
A Better Spur Should Start From Each Objective
摘要
现实世界中的多目标强化学习(MORL)经常会遇到奖励稀疏、奖励冲突和后期奖励拉锯战的问题,导致传统的线性标量化经历严重的度量振荡。为了解决现实部署场景中多个目标之间的优化冲突,我们提出了多边际偏好优化(MMPO),这是一种在数据、梯度和约束级别进行干预的细粒度框架,而不是依赖于粗粒度的全局标量化。具体来说,MMPO 执行曝光去偏以减轻稀疏和有偏差的奖励,应用优先级感知正交投影来解耦冲突的梯度,并引入自我提示的梯度约束以防止主导目标压倒较弱的目标。对现实世界电子商务数据集的实验表明,MMPO 提高了训练稳定性,并在相互冲突的指标中持续实现更好的性能。此外,它可以稳健地推广到更广泛的任务,例如 ToolRL 和代码生成,证明了它作为多目标对齐的实用范例的有效性。