论文

SPARD:融合奖励动态与数据效用的RL对齐自步课程

SPARD: Self-Paced Curriculum for RL Alignment via Integrating Reward Dynamics and Data Utility

模型训练强化学习

摘要

大语言模型(LLM)的演进正将焦点从单一、可验证的任务转向复杂、开放的现实世界场景,给后训练阶段带来了重大挑战。在这些场景中,奖励系统的规模与复杂度显著增长,正转向涵盖模型能力与应用场景全谱系的多目标形式化。然而,传统方法通常依赖固定的奖励权重,忽视非平稳的学习动态,并难以应对跨维度的数据异质性。为解决这些问题,我们提出SPARD,该框架通过感知学习进度来动态调整多目标奖励权重与数据重要性,建立自动化的自步课程,从而使学习意图与数据效用同步以获得最优性能。在多个基准上的大量实验表明,SPARD显著提升了模型在所有领域的能力。

SPARD:融合奖励动态与数据效用的RL对齐自步课程:论文配图
图 1:标准多奖励 RL 循环的图示以及跨不同数据类型的训练特征示例。上图描绘了通过LLM法官生成多重奖励并将其聚合以进行政策更新的工作流程。下图突出显示了数据异质性,表明不同类型的输入数据在训练过程中对特定奖励维度的影响存在差异。