论文
从RLVR到RLSVR:任务变换为开放式LLM自我改进诱导自可验证奖励
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
摘要
可验证奖励强化学习(RLVR)通过支持大规模优化,推动了近期面向推理的大语言模型(LLM)的进展。然而,其适用范围仍主要局限于数学与代码等正确性可确定性验证的领域。开放式任务则往往依赖人类偏好、奖励模型或基于LLM的裁判,带来评估偏差、裁判能力瓶颈与额外推理成本。借鉴自监督学习通过构造前置任务从数据自身获得监督信号的原理,我们提出自可验证奖励强化学习(RLSVR),一个基于任务变换的训练范式,把RLVR扩展到开放式任务。RLSVR把开放式任务变换为可验证的代理环境,其内部规则与交互结果自动生成奖励信号。我们以SpyRL实例化RLSVR,这是一种受社交推理游戏“谁是卧底?”(Who Is the Spy?)启发的Self-PlaY强化学习方法。智能体接收非对称信息,完成同一目标任务,并投票找出被指定的卧底。由于卧底身份是预先确定的,投票结果提供完全可验证的奖励,同时成功识别仍与输出质量密切相关。在文本摘要、创意写作与数学推理上的实验表明,SpyRL在不可验证任务上优于现有自我改进方法,并在可验证推理任务上带来一致增益。这些结果证明,任务变换可以把可扩展的RLVR式自我改进扩展到本质可验证领域之外。模型与代码已发布于 https://github.com/wangqinsi1/RLSVR/tree/SpyRL。
