论文

RISE-RL:面向开放式强化学习的量规引导选择性探索

RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning

模型训练强化学习

摘要

将大语言模型(LLM)对齐到开放式任务颇具挑战,因为回复必须满足多维标准,却不存在唯一正确的生成轨迹。现有基于量规的强化学习(RL)方法把细粒度的标准级反馈压缩为标量奖励,使得在有限的同策略探索下难以针对持续存在的能力短板。我们提出RISE-RL(量规引导的选择性探索,Rubric-Informed Selective Exploration),利用反复未命中的量规标准引出仅靠无引导探索难以发现的特权轨迹。RISE-RL只保留完整量规奖励超过自然rollout平均奖励的轨迹,然后在原始提示词下重评这些轨迹,以突出自然策略仍然支持不足的行为。所得引导信号通过单独的辅助目标进行优化,并在其额外收益递减后移除。在4B与14B模型上覆盖写作、聊天、健康与科学的实验显示,RISE-RL在无引导评测下于每个受测基准都取得最高均分。与标准Rubric-RL相比,它在4B规模将平均分提高1.3分,在14B规模提高3.3分,其中CreativeWriting-V3提升6.0分。它还提升了创意写作多样性,并在客观计分的医学与科学基准上带来增益。这些结果表明,通过奖励过滤与策略支持塑形实现的选择性内化,对开放式强化学习行之有效。

RISE-RL:面向开放式强化学习的量规引导选择性探索:论文配图
图1:RISE-RL中引导-探索机制概览。选择性量规引导解决标准失效问题并扩展可访问的策略空间。一旦这些行为变得可访问,引导即被移除,训练继续通过自主的在线策略(on-policy)探索进行。