论文
GeoMin:通过几何分布建模实现数据高效的半监督 RLVR
GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling
摘要
具有可验证奖励的强化学习(RLVR)显着推进了 LLM 推理,但它面临着一个困境:标准的监督缩放受到高注释成本的限制,而无监督替代方案则遭受严重的模型崩溃。最近的半监督 RLVR 方法通过使用小型标记集来指导未标记数据来解决这个问题,从而在训练效果和注释成本之间实现有希望的权衡。然而,由于依赖粗略的性能启发法,它们面临严重的数据效率瓶颈,导致绝大多数有价值的实例未得到充分利用。为此,我们提出了GeoMin,它对标记数据的全局特征分布进行建模,以解码正确和错误执行轨迹之间的结构差异,从而建立鲁棒先验来评估自我奖励信号的可靠性,并充分释放未标记数据的潜力。根据经验,GeoMin 的性能比最强的基线高出 4.1%,甚至超过了只有 10% 注释的完全监督模型,展示了卓越的数据效率。