论文

自一致性引出与奖励设计的预注册因果分区

A Pre-Registered Causal Partition of Self-Consistency Elicitation and Reward Design in RLVR

模型评测模型训练强化学习评测方法与指标RLVR

摘要

即使奖励信号是虚假的,基于可验证奖励的强化学习(RLVR)也能改善推理——将功劳分配给群体多个答案而不是真实验证者。从业者通常将 naive = acc(TRUE) - acc(RANDOM) 解释为奖励设计效果。我们证明这个估计值存在系统性偏差:它将自我一致性启发(通过多数伪奖励强化策略以达到其模态答案)与真正的奖励设计信号混为一谈。使用受控表格 GRPO 模拟器,我们得出精确的伸缩分解总计 = null + elicit + rd 并跨五个先验强度级别测量每个项。朴素估计器的奖励设计分数范围从弱先验 (ps=0.20) 的 0.139 到强先验 (ps=0.80) 的 0.05,其中引出项在自洽交叉处翻转符号。预先注册的 2x2x2 阶乘证实了非可加性(相互作用比 0.385;AxC 效应 -0.089)。点与边界的试点门显示强先验机制是点识别的,而近交叉机制仅是有界的。对两个命名的已发布结果的重新审核分别得出 ELICITATION DOMINATED(启发份额 0.98)和 REWARD DESIGN DOMINATED(rd 份额 1.18)结论,证明了分区的诊断价值。我们预先承诺无论翻转结果如何都会提交;不翻转是同等地位的发现。我们发布了一种可重复使用的单命令工具,适用于任何对齐纸来运行相同的审核。