论文
REVES:修订和验证——测试时间扩展的增强训练
REVES: REvision and VErification--Augmented Training for Test-Time Scaling
摘要
通过顺序修订的测试时间扩展已成为增强 大语言模型 (LLM) 推理的强大范例。然而,标准 后训练 方法主要优化单次目标,从而与多步推理动力学产生根本性的偏差。虽然最近的工作将其视为多轮强化学习(RL),但传统方法直接优化多步骤轨迹,未能进一步利用模型可以通过纠正错误来学习的中间步骤中的高质量错误。我们提出了一个两阶段迭代框架,在在线数据/提示增强和策略优化之间交替。通过将成功恢复轨迹中的中间步骤(“未遂”答案)转换为解耦的修订和验证提示,我们的方法将训练集中在有效的答案转换和错误识别上。与标准多圈强化学习相比,这种方法可以实现高效的 离策略 数据生成,并减少长范围采样的计算开销。在 LiveCodeBench 上,使用公开的测试用例作为反馈,我们观察到比 RL 基线提高了 +6.5 分,比标准多轮训练提高了 +4.0 分。除了编码之外,我们的方法与之前报告的循环封装上的 SOTA 结果相匹配,同时使用最小的基本模型 (4B),并且比更大的进化搜索系统少得多的采样轨迹。 真值验证下的数学结果进一步证实了校正能力的提高。它还推广到分布外约束满足难题,例如 n\_queens 和 mini\_sudoku,其中正确性完全由问题约束定义。代码可在 https://github.com/yxliu02/REVES.git 获取。