论文

EvoRS:面向开放式强化学习的同策略奖励系统自演化

EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

开放型强化学习常依赖基于规则的奖励来处理无法直接验证答案的任务。然而,策略与奖励系统之间形成动态反馈循环:当策略优化当前奖励时,初始有效的奖励系统可能因奖励黑客行为或响应可区分性下降而变得不可靠。因此,奖励系统应在训练过程中演化而非保持固定。现有动态规则方法会调整评估标准,但奖励失效也可能源于评分机制或信号构成问题。我们提出EvoRS,一种基于策略经验自演化的强化学习框架,将奖励系统表示为可执行的奖励有向无环图(Reward-DAG)。具体而言,一个智能体设计师通过同策略轨迹和奖励轨迹更新该系统,以维持训练期间的可靠性。在写作和角色扮演任务中,EvoRS在三个评委的评估中均取得最优质量,分别领先策略2.107和4.767分,同时减少奖励黑客和覆盖失败,并保持奖励信息量。消融实验证实,一个全面的固定奖励系统在开放型任务中无法维持可靠性,必须在训练过程中持续演化。

EvoRS:面向开放式强化学习的同策略奖励系统自演化:论文配图
图1:开放式强化学习中的奖励系统演化。策略学习暴露奖励有效性、覆盖面和信息量方面的问题后,EvoRS利用当前策略经验生成并比较候选奖励系统,使奖励系统随策略共同演化。