论文

通过奖励相关策略优化的多目标和混合奖励强化学习

Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization

模型训练强化学习

摘要

复杂的强化学习环境经常采用多任务和混合奖励的公式。在这些环境中,异质的奖励分布和相关的奖励维度通常会破坏标量优势的构建的稳定性。为了应对这些挑战,我们提出了奖励相关策略优化(RDPO),这是一种旨在明确针对两种故障模式的奖励处理方法。 RDPO 首先利用幅度感知分位数标准化来稳定二进制、分数和连续奖励的提示级优势分配。然后,它在每个主动奖励子空间内应用马哈拉诺比斯白化,以在聚合之前减轻相关冗余。当在 LongCat-Flash 的 后训练 期间应用时,RDPO 增强了指令跟踪、写入质量和对硬提示的鲁棒性,同时在推理和编码评估方面保持广泛的竞争力。