论文
FABSVer:LLM 数学推理更快的训练和更好的自我验证
FABSVer: Faster Training and Better Self-Verification for LLM Mathematical Reasoning
摘要
虽然 大语言模型 在数学推理方面取得了重大进展,但他们在判断自己的解决方案的正确性方面仍然不可靠。为模型配备自我验证功能的现有方法通常将解决方案生成和验证视为两个独立的任务,从而导致训练时间大幅增加。在本文中,我们提出了 FABSVer,它将这两个任务融合到一个生成过程中,大大减少了训练开销,同时联合优化了这两种功能。我们进一步从理论上和经验上确定了收敛瓶颈:随着训练的进展,奖励达到稳定状态,因为策略受到固定参考模型的约束。为了克服这个问题,我们引入了动态参考模型更新(DRMU),它提高了奖励上限并实现奖励的持续增长。对数学基准的大量实验表明,FABSVer 在三个模型尺度上实现了卓越的自我验证和推理性能,同时只需要现有方法 51%--71% 的训练时间。分析进一步揭示了模型如何获得自我验证的不同学习阶段,并且随着模型规模的增加,验证和回答奖励之间的差距显着缩小。