论文

用人类管理换取 RLVR 中的综合增强

Trading Human Curation for Synthetic Augmentation in RLVR

模型训练合成数据

摘要

高质量训练任务的提供是代理语言模型上可验证奖励(RLVR)强化学习的中心瓶颈。每个任务都需要沙盒设置、提示和手工编写的奖励函数,并且只有通过质量标准的任务才会产生有用的训练信号。达到这个质量标准的手工管理无法经济地扩展到有效强化学习训练所需的任务计数,并且自动生成的任务变体和人工编写的任务变体之间的替代率尚未确定。我们研究使用预先指定的、经过门过滤的小型手工编写基础的增强来替代 RLVR 期间的额外人工管理。我们将增强任务和人工创作任务之间的成本调整交易率 $ρ_{\text{cost}}$ 形式化,通过具有不同增强份额的训练语料库的受控消融来衡量它,并描述增强管道的端到端经济性。用增强内容替换其他人工编写的任务,保留了对涵盖代码、指令跟踪、推理和多轮代理函数调用的十个基准套件的聚合概括。门控合成任务和人类编写的 RLVR 任务之间的成本调整后交易率 $ρ_{\text{cost}}$ 在合理的 $c_{\text{ human}}/c_{\text{aug}}$ 范围内保持在 $[1.4\times, 11.6\times]$ 范围内。