论文

CircuitLens:推理电路作为数据选择信号,用于具有可验证奖励的强化学习

CircuitLens: Reasoning Circuits as Data Selection Signals for Reinforcement Learning with Verifiable Rewards

模型训练强化学习合成数据RLVR

摘要

可验证奖励的强化学习(RLVR)对模型训练的问题很敏感,但现有的选择标准——难度过滤、手工管理、奖励轨迹评分——将数据价值评估为问题的内在属性,独立于从中学习的模型。我们引入了推理回路分数(CRS),这是一种选择信号,源自通过对比消融识别的 46 个推理敏感注意力头,在没有奖励标签或轨迹采样的情况下在冻结基础模型上的单次前向传递中计算。 CRS 违背了直观的假设,即更强的推理电路参与度会产生更好的训练数据:在 Qwen2.5-Math-7B 上,参与度最低的十分位数在三个中等难度基准(GSM8K +2.0 pp、OlympiadBench +1.6 pp、Minerva +2.9 pp)上比随机选择有所改进,而参与度最高的十分位数的增益较小,并且与中间参与度的十分位组无法区分。优点是有边界条件:在域管理的池中,没有选择方法与其他方法分开;在 1.5B 尺度下,有用方向有所不同;最低奖励的训练条件产生最强的下游泛化。在测试的 Qwen2.5-Math 设置中,RLVR 数据选择似乎依赖于机制,而不是可简化为问题质量的静态排名。