论文

携带证明的认知:用真实结果结算奖励弥合验证缺口

Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward

模型训练强化学习奖励建模与过程监督RLVR

摘要

语言模型推理的前沿成果来自于推理轨迹的强化学习,并且集中在具有廉价、可靠验证器的领域。我们认为该领域的约束性约束是验证差距:在正式领域之外的推理没有可扩展的、廉洁的奖励。我们做出四项贡献。 (1) 理论:在 N 最佳选择的联合高斯模型中,验证者-黄金相关性 rho 是测试时计算和能力之间的精确交换率,不健全的验证者将付出多项式惩罚 N^(1/rho^2);无边际联结形式预测实际 LLM 法官的实际稳健性为 4% 的中值误差。 (2) 演示:在具有可执行基本事实的程序综合测试台中,包括预先注册的缩放复制,随着优化的增长,不健全的验证者会失去压力下的健全性(N = 4096 时为 0.94 到 0.32),而健全的验证者则单调改进;现实锚定的解决方案在 I.I.D. 下击败了冻结的验证者和对抗压力,将黑客差距从 ~0.27 推至 ~0;稳健性与固定标签呈对数线性缩放,策略内结算的标签效率比随机标签高约 10 倍。将真正的 LLM 法官和单元测试执行视为黄金,较弱的法官会在 N 次最佳 (p<0.001) 下失去稳健性,较强的法官会更加稳健,仅选择就会与诚实样本产生 +0.53 的黑客差距。在真实的 GRPO 训练下,冻结奖励模型会追踪完整的过度优化曲线(执行奖励下降 90%),而在 10% 结算流上进行修改的同一模型则保留了执行奖励的 6 倍。 (3)范式:带有证据的认知,其中推理步骤是由仅根据现有现实进行训练的自建世界模型定价的概率主张,并通过适当的评分规则解决。 (4) 基准:我们指定压力下的稳健性作为现实解决推理基准的标题指标。