论文

DE-Venus:大语言模型 的数据高效 RLVR 框架

DE-Venus: A Data-Efficient RLVR Framework for Large Language Models

模型训练强化学习

摘要

具有可验证奖励的强化学习 (RLVR) 改进了 大语言模型 推理,但其实际扩展受到昂贵的 同策略 部署和大规模获取可靠目标的成本的限制。现有方法分别解决样本选择、不完整监督或噪声标签的问题,通常将监督逻辑与分布式训练纠缠在一起,并阻碍受控比较和重用。我们提出了 DE-Venus,这是一个数据高效 RLVR 的统一框架,它将监督视为数据准备和策略优化过程中不断发展的状态。它将这个生命周期组织为三个模块: 主动数据选择分配训练和注释预算;弱监督构建从未标记的示例中获取学习信号;训练时间监督细化过滤或纠正不可靠的监督。 DE-Venus 支持七种代表性方法和数据选择管道,将特定于方法的决策表示为离线数据集转换或目标、奖励、批次和优势的在线转换,同时保留 verl 的分布式执行合约。在公共基准和三个业务场景中,单独的配置仅用 10% 的标签或少至 13% 的相关数据即可保持或提高模型质量;选定的业务配置还将观察到的收敛步骤减少了 63%--75%。因此,DE-Venus 可以在不牺牲可扩展的 RL 执行的情况下降低注释和训练成本。