论文

从RLVR到RLSVR:任务变换为开放式LLM自我改进诱导自可验证奖励

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)通过支持大规模优化,推动了近期面向推理的大语言模型(LLM)的进展。然而,其适用范围仍主要局限于数学与代码等正确性可确定性验证的领域。开放式任务则往往依赖人类偏好、奖励模型或基于LLM的裁判,带来评估偏差、裁判能力瓶颈与额外推理成本。借鉴自监督学习通过构造前置任务从数据自身获得监督信号的原理,我们提出自可验证奖励强化学习(RLSVR),一个基于任务变换的训练范式,把RLVR扩展到开放式任务。RLSVR把开放式任务变换为可验证的代理环境,其内部规则与交互结果自动生成奖励信号。我们以SpyRL实例化RLSVR,这是一种受社交推理游戏“谁是卧底?”(Who Is the Spy?)启发的Self-PlaY强化学习方法。智能体接收非对称信息,完成同一目标任务,并投票找出被指定的卧底。由于卧底身份是预先确定的,投票结果提供完全可验证的奖励,同时成功识别仍与输出质量密切相关。在文本摘要、创意写作与数学推理上的实验表明,SpyRL在不可验证任务上优于现有自我改进方法,并在可验证推理任务上带来一致增益。这些结果证明,任务变换可以把可扩展的RLVR式自我改进扩展到本质可验证领域之外。模型与代码已发布于 https://github.com/wangqinsi1/RLSVR/tree/SpyRL。

从RLVR到RLSVR:任务变换为开放式LLM自我改进诱导自可验证奖励:论文配图
图 1:RLSVR 将 RLVR 的精确验证与自监督学习的按构建标签原则结合起来。 (a) RLVR 根据已知的正确答案对输出进行评分,从而实现基于规则的精确奖励,但仅限于存在此类答案的领域(例如数学)。 (b) SSL 构造一个借口任务,其标签是根据数据本身自动生成的。 (c) RLSVR 将 RLVR 与 SSL 结合起来:它将开放式任务转换为代理环境,该环境预先分配一个潜在变量作为可验证的答案,以便可以根据环境自己的记录准确检查奖励。