虚假边界:诊断和减轻自我进化搜索Agent中的共同作弊
False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents
摘要
自我进化的搜索Agent通过联合优化生成问题的提议器和回答问题的求解器来构建自己的训练课程。这种闭环引入了一种我们称之为共同作弊的失败模式:提议者和求解者越来越多地就共同错误达成一致,因此内部奖励得到改善,而外部正确性却没有相应的增益。针对源证据的事后审计表明,在连续几轮的自我进化中,共同作弊变得更加严重,即使循环训练信号有所改善,伪标签正确性也会停滞或下降。最直接的缓解措施是在训练前验证提案:我们引入了多样本验证(MSV),它使用源查询同一模型三次,不使用源查询同一模型三次,以决定任务准入并替换不可靠的伪标签。 MSV 部分减少了错误一致性,但留下了大量残留的共同作弊行为,并且每个候选者额外花费了六代贴标机。这些限制激发了我们的主要方法 CrossFit:它将提案者的源文档分为 A 组和 B 组;由 A 生成的问题由仅在 B 上训练的辅助求解器评分,反之亦然。交叉拟合协议决定了提议者奖励,因此无法通过反馈求解器重现同源伪标签,而原始求解器的更新规则不变。使用 Qwen3.5-4B 和 Qwen3.5-9B 重新运行循环,MSV 将错误一致性质量从 6.1% 减少到 5.7%,从 8.8% 减少到 7.2%,而 CrossFit 将其减少到 3.0% 和 3.7%。使用排除源的反馈重播相同的提案进一步将错误同意率降低到 0.4% 和 0.1%,从而将反馈来源与课程变化隔离开来。在七个下游搜索基准测试中,CrossFit 在 4B 和 9B 上比标准耦合自进化提高了 8.8 和 8.4 点的平均性能,比 Search-R1 提高了 8.7 和 7.8 点。