论文
从推理字符串到偏序:通过商策略优化进行验证者认证的规则传输
From Reasoning Strings to Partial Orders: Verifier-Certified Rule Transport through Quotient Policy Optimization
摘要
许多计算承认多个有效的执行顺序,因为独立的子目标或不相交的状态更新可以交换。具有可验证奖励的强化学习通常将每个成功的跟踪视为一个单独的词元序列,因此序列化选择可能会被误认为是逻辑依赖关系。我们引入了验证者认证规则传输(VCRT),它使用本机验证者重放相邻的操作对。两个订单被接受并达到相同规范状态的配对提供换算证书;拒绝或改变状态的逆转提供反钻石。 VCRT 使用反钻石来保留真正的先决条件,并将政策信用分配给每个经过认证的轨道的总概率质量。它还限制了交换后的一致性、源保留和策略漂移。我们通过共享的匿名关系图接口评估 ProofWriter、CLRS 和 Lean 之间的留一环境迁移。所有训练和检查点决策在保留评估之前都被冻结,该评估对每个项目使用一个贪婪轨迹,无需搜索或验证者反馈。 VCRT 的宏观通过率为 77.60%,而最强匹配基线的宏观通过率为 64.53%,配对增益为 13.06 点(95% bootstrap CI [12.58, 13.54])。 Lean 贡献了 33.49 分的大部分进步,而 ProofWriter 和 CLRS 平均提高了 2.85 分。机制测试始终有利于反钻石监督,而无轨道在统计上与完整的 VCRT 没有区别。证据并未证明精确轨道聚合具有普遍益处。