论文

从更少中学习:测量RLVR在低数据与低算力情形下的有效性

Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes

模型评测模型训练强化学习模型能力评测RLVR

摘要

微调大语言模型(LLM)通常依赖大量高质量标注数据,或在可验证奖励强化学习(RLVR)的情形下依赖具有明确标准答案的问题。尽管以往工作已通过扩展RLVR所用的数据与计算探索其对模型推理能力的收益,这些结果在标注数据和可用算力可能稀缺的许多现实场景中缺乏适用性。在本工作中,我们对开源小语言模型(SLM)在低数据量情形下经过RLVR后的表现进行了全面的实证研究。我们通过三个新颖数据集——涵盖数字计数问题、图推理和空间推理——刻画了模型性能如何随数据集规模、多样性和复杂度扩展。我们证明:(1) 程序化数据集支持具有可控属性(规模、多样性和复杂度)的细粒度评估与训练数据集开发;(2) 在RLVR下,在较低复杂度任务上训练的模型能够泛化到更高复杂度的任务;(3) 在混合复杂度数据集上训练在低数据量情形下带来最大收益,与在简单任务上训练相比可提供高达5倍的样本效率。这些发现为RLVR数据缩放定律的开发、以及使用程序化数据生成器进一步理解面向高效LLM微调的有效数据开发的未来工作提供了启发。

从更少中学习:测量RLVR在低数据与低算力情形下的有效性:论文配图
图 6:测试空间推理中不同类型查询的准确性。这里,AO、AL代表绝对方向和绝对位置,同样,RO、RL代表相对查询。在简单和混合设置中,我们看到所有类型查询的改进。这些改进在位置和相对方向查询上更为明显。此外,在混合设置中,相对方向查询的性能要好得多。