论文
以更少学更多:不确定性一致性引导的RLVR查询选择
Learn More with Less: Uncertainty Consistency Guided Query Selection for RLVR
摘要
大语言模型(LLM)近来通过可验证奖励强化学习(RLVR)提升数学推理。然而,现有RLVR算法需要大量查询预算,使标注成本高昂。我们研究更少但信息量更大的查询能否产生相似或更优的性能,将主动学习(AL)引入RLVR。我们发现经典AL采样策略在此设定下未能胜过随机选择,原因是仅按主观不确定性选择时忽视了客观不确定性。本工作提出不确定性一致性指标,评估主观不确定性与客观不确定性的吻合程度。在离线设定下,这一对齐用点二列相关系数(PBC)度量。对于在线训练,由于采样有限且输出分布动态变化,PBC估计困难。因此,我们引入一个新的在线变体,由归一化优势与主观不确定性计算得出。理论上,我们证明在线变体与离线PBC严格负相关,并支持更好的样本选择。实验表明,我们的方法持续优于随机与经典AL基线,仅用30%数据训练即达到全数据集性能,有效降低RLVR用于推理任务的成本。
