论文

ANCORA:通过流形锚定的自我游戏学习提问以进行可验证的推理

ANCORA: Learning to Question via Manifold-Anchored Self-Play for Verifiable Reasoning

模型训练强化学习

摘要

我们提出了向开放式课程自我游戏的范式转变:统一的策略不是学习在固定的提示集上回答,而是学习提出问题:产生可验证的问题,解决它们,并将验证者的反馈转化为自我改进,而无需人工注释的解决方案。我们引入了 ANCORA,其中策略在综合新颖规范的提议者和生成经过验证的解决方案的求解器之间交替,由三种承载机制锚定:两级组相对更新,将跨规范的提议者优势与跨解决方案尝试的求解器优势耦合起来;迭代自蒸馏 SFT 在 RL 之前将基本模型投影到其有效输出流形上;以及 UCB 引导的课程 DAG,其政策引发的问题集可以在自我组合下证明扩展。如果没有这些稳定器,即使在 MLRL 一致的奖励下,稀疏的验证者反馈也会导致提议者崩溃;与他们一起,ANCORA 从零人类解决方案中引导出可验证的课程。在 Verus 中实例化后,ANCORA 在测试时训练(TTT,0-shot)中将 Dafny2Verus pass@1 从 26.6% SFT 基线提升到 81.5%,尽管 PSV 是 1-shot 推理,但其性能仍比 PSV self-play 好 15.8 分;在转移设置中,使用 Dafny2Verus 种子进行的训练在保留的 MBPP 和 HumanEval 上的通过率分别为 36.2% 和 17.2%。