论文
谁验证验证器:让可检查裁判与自改进Agent协同演化
Who Verifies the Verifier? Co-Evolving Inspectable Graders with Self-Improving Agents
摘要
我们修改了Agent:它真的变好了吗?每个自我改进Agent循环都会回答这个问题数百次,而每次答案都来自验证器。开放式任务没有现成验证器,因此循环通常被交给人工编写的评分准则,或直接由与被测模型相似的LLM裁判打分,这容易引发奖励投机和共同盲点。我们把验证器本身作为演化对象:它是由小型、主要为确定性的缺陷检测器组成的可检查表达式,从聚类失败中合成,生成时受准入门控,并依据与十项锚定参考集的一致性及未标注输出上的共识选择,绝不按Agent得分选择。在MBPP+上,每个种子都使留出集一致性相对手写初始组合提高0.21,最终超过组合中包含的独立LLM裁判。一个发现应改变协同演化验证器的验证方式:移除锚定护栏会使验证器退化为空洞的始终放行裁判,但这个退化裁判训练技能的效果仍然一样好。下游任务得分无法认证自演化验证器。任务得分确实能回答充分性问题:在这方面,演化验证器可以作为替代。Double Ratchet将验证器与受生命周期管理的技能循环配对,在代码生成、企业文本到SQL和无参考报告生成中,保留了同一循环使用真实答案或评分准则时增益的88%—110%。当演化技能利用报告评分准则投机时,外层裁判发现了问题,并通过增加一个检测器修复;但在提供任务契约之前,外层裁判本身也判断错误。