论文
AutoVerifier:用于基于参考的答案验证的残差引导非参数优化
AutoVerifier: Residual-Guided Non-Parametric Optimization for Reference-Based Answer Verification
摘要
基于参考的验证器对于评估推理模型并在具有可验证奖励的强化学习中提供准确的结果奖励非常重要。为了提高验证准确性,之前的工作探索了基于规则、基于模型和工具增强的验证器,用于检查不同答案形式的答案等效性。然而,$1+3.14$ 和 $1+π$ 等答案形式的等价性可能取决于问题和评分标准。我们将这种隐含假设称为验证者归纳偏差。为了应对这一挑战,我们提出了 AutoVerifier,这是一种残差引导的非参数优化方法,可以从反复出现的验证器错误中学习这些偏差。具体来说,AutoVerifier 在规则卡中记录这些偏差,并仅在重放验证未检测到直接回归后将其提升为代码模块或提示指导,从而保持已接受的更新可审核、可编辑和可重用。对四个验证器基准的实验表明,AutoVerifier 的性能大大优于最先进的验证器。