论文
在模型学会漏洞之前:对RLVR验证器进行模糊测试
Before the Model Learns the Bug:Fuzzing RLVR Verifiers
摘要
可验证奖励强化学习(RLVR)用可执行的奖励函数取代人工偏好标签,例如数学答案检查器、JSON工具调用验证器和代码单元测试框架。这使得奖励在某种程度上成为一种软件产物:如果验证器有错,优化过程可能把bug学进去。我们用一个轻量的验证器模糊测试框架研究这种失效模式:它生成对抗性补全,比较有缺陷的验证器与更严格的参考验证器,记录成对决策,并报告假阳性、假阴性、分歧、可利用项和不确定性等指标。