论文

SAW:大语言模型 中多目标强化学习的阶段感知动态加权

SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models

模型训练强化学习

摘要

尽管多目标强化学习(MORL)对于使 大语言模型 与复杂的人类偏好保持一致至关重要,但静态加权求和的流行实践忽略了一个更基本的现象:奖励学习在各个目标之间明显异步。充分学习的维度会快速产生同质、低方差的信号,其残余噪声会污染聚合奖励(在 GRPO 中)或占据优势预算的固定份额(在 GDPO 中),从而干扰学习不足的维度所携带的稀缺但高价值的信号。为了解决这种异步问题,我们提出了阶段感知动态加权(SAW),这是一种轻量级的、与算法无关的动态加权机制。 SAW 利用变异系数 (CV) 作为实时信息量的尺度不变代理,通过批次内的相对信息量重新加权每个维度的奖励或优势贡献。与需要多次前向和后向传递的基于梯度的方法不同,SAW 仅依赖于批次级统计数据,引入的计算开销几乎可以忽略不计。工具调用和文本摘要任务的实验表明,SAW 在 GRPO 和 GDPO 框架下持续提高训练效率和最终性能,证实其作为多奖励 LLM 对齐的通用插件。我们的代码可在 https://github.com/Zhaolutuan/SAW 获取