论文
混合策略而非奖励:多奖励强化学习的策略分解与优化
Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL
摘要
现代大语言模型(LLMs)不仅期望正确地回答问题,还期望适应不同的人类价值观和使用场景。因此,多奖励强化学习(RL)已成为LLMs的一个重要问题,其中每个奖励捕捉了不同的期望行为方面。然而,使用多个奖励进行优化面临严重的对齐税问题,不同优化目标可以互相妥协甚至冲突,导致训练后的不稳定和低效。在这项工作中,我们提出了PRISM,这是一种基于政策空间分解和组合的新多奖励RL框架。与传统的复合奖励不同,PRISM优化一组独立的正面政策和一个全局的负面政策。这消除了多奖励政策优化期间的潜在冲突,同时通过灵活的政策组合使推理期间的可控性得以实现。在科学推理、工具使用推理和帮助-安全对齐等实验中,PRISM始终优于现有的多奖励RL基准,同时为推理时间内的偏好控制提供了额外的可控性。