论文
用于训练和测试时自我改进的自训练验证
Self-Trained Verification for Training- and Test-Time Self-Improvement
摘要
大规模的自我改进一直是推理模型的长期目标,并且有两个自然的地方可以做到这一点:在测试时,通过验证-细化(V-R)循环;并在训练时通过自我训练方法。两者都受到相同瓶颈的控制:验证者。当验证者分数膨胀而准确性停滞不前,以及当反馈过于笼统而无法采取行动时,V-R 循环就会停止;当将不良的自生成数据添加到训练中时,自训练也会失败。更好的验证可以解锁两者,但是我们想要训练的能力,即捕获自身生成的错误,缺乏训练信号。为了应对这一挑战,我们提出了自训练验证(STV)。我们的主要观察结果是,虽然模型无法单独捕获这些错误,但当显示参考解决方案时,它可以捕获这些错误。我们将这种不对称性转变为监督目标,并训练验证者模仿其自身的更明智的版本。在测试时,STV 显着改善了难题上的 V-R 循环,而替代方案(例如 SFT、验证者分数上的 RL,甚至元验证者)却没有。 STV 大约使硬数学的准确率提高了一倍,并将科学推理任务的准确率提高了 14 倍(1.5% 至 21%)。在训练时,我们还使用 RL 和 V-R 循环内的 STV 验证器反馈来训练生成器 - 我们称之为验证器在环训练 (ViL) 的过程。从 RL 聚合生成器开始,ViL 在 pass@1 中进一步产生 33% 的增益。更值得注意的是,在测试时没有验证器的情况下,生成器的独立 pass@1 相对于标准 RL 收敛的位置上升了 30%。因此,推理难题的下一个前沿可能在于我们如何训练和验证验证。网站:https://ar-forum.github.io/stv-webpage