论文

DVAO:多奖励强化学习的动态方差自适应优势优化

DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning

模型训练强化学习

摘要

强化学习已成为使 大语言模型 与人类意图和任务要求保持一致的标准范例。虽然组相对策略优化为邻近策略优化提供了一种高效、无价值模型的替代方案,但使其适应现实世界的多奖励设置仍然具有挑战性。标准的量化实践,例如奖励组合和优势组合,存在重大缺陷:奖励组合经常产生平方过大的优势,从而导致训练不稳定,而优势组合依赖于静态超参数并忽略跨目标相关性。为了解决这些限制,我们提出了动态方差自适应优势优化(DVAO),它根据轨迹采样组内每个目标的经验奖励方差动态调整组合权重,有效地提高具有更强学习信号的目标的权重,同时抑制噪声目标。我们在数学上证明了 DVAO 保持了稳定训练的有界优势幅度,并引入了自适应跨目标正则化机制。使用 Qwen3 和 Qwen2.5 模型进行的数学推理和工具使用基准的大量实验表明,DVAO 显着优于基线方法,实现了卓越的多目标 Pareto 前沿和强大的训练稳定性。