论文

通过符号递归自对准通过验证推理稳定迭代自训练

Stabilizing Iterative Self-Training with Verified Reasoning via Symbolic Recursive Self-Alignment

模型训练合成数据

摘要

递归自我改进(模型根据自己的输出进行迭代训练)有望实现持续的能力增长,但面临一个根本障碍:递归漂移。当模型在多次迭代中对自生成的数据进行训练时,中间推理中的错误会复合,导致模式崩溃和性能下降。我们提出了神经符号递归自对准(NSRSA),它通过嵌入符号验证子系统来稳定迭代自训练,该符号验证子系统在推理步骤级别控制训练数据质量。与仅结果过滤(允许有缺陷的推理的“幸运猜测”)不同,NSRSA 通过 sympy 验证每个算术运算,检查推理步骤之间的逻辑流一致性,并强制执行域约束。我们使用 Qwen3-4B-Thinking 在 5 次自训练迭代中评估 GSM8K 上的 NSRSA,并在以下五种条件下进行:无验证、结果验证、多数投票、完整 NSRSA 符号验证以及带有 DPO 的 NSRSA。我们的过滤分析表明,NSRSA 拒绝了大约 34% 通过结果验证的正确答案解决方案,消除了训练集中推理有缺陷的“幸运猜测”。我们进一步证明,通过 NSRSA 验证构建 DPO 偏好对可以教会模型区分声音和有缺陷的推理(奖励准确度为 46% 到 63%)。 NSRSA 提供了一个可扩展的框架,该框架演示了外部符号验证如何在可进行自动验证的领域内使递归自我改进变得可测量且可靠。