论文

黑暗中的智能选择:通过追踪元认知枢轴实现高效的 RLVR 推理

Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots

模型训练合成数据

摘要

具有可验证奖励的强化学习(RLVR)极大地改进了大型推理模型(LRM),但它需要在巨大的完全注释数据集上进行及时训练。为此,数据高效的 RLVR 方法已从两个角度进行了广泛研究:(i)数据选择方法识别一小部分优质样本,这些样本可产生接近完整的数据性能,但它们依赖于预先存在的标记数据池。 (ii) 无监督 RLVR 方法使用其自身的内部监督信号对大规模未标记数据训练模型,但它们表现出次优性能。因此,我们研究了 RLVR 的“黑暗中挑选”设置,其目的是在没有事先监督的情况下选择最有利于训练且值得注释的未标记样本。通过系统分析,我们证明智能选择取决于经过良好校准的不确定性估计器,以实现自适应训练制度的数据战略分区。基于这一见解,我们提出了 PivotTrace,这是一种三向数据分类框架,利用注意力动态来跟踪推理过程中的元认知枢轴。通过枢轴密度精确量化不确定性,PivotTrace 实现了自动化数据路由,以协同最大化注释和训练效率。根据经验,PivotTrace 超越了完全监督的 LRM,仅 29.3% 带注释的样本和 2.75 快的收敛速度。