论文

学习打破评审的策略

Learning Strategies to Break Judges

模型评测安全与风险评测

摘要

随着人工智能Agent超越人类的表现,系统设计人员直接评估它们并了解它们的故障模式变得异常困难。因此,Agent本身被广泛部署来评估、判断模型轨迹并提供反馈。但这提出了一个重要的问题:我们如何才能相信评审?在这项工作中,我们提出了一种Agent引导的方法来查找 agentic 判断的弱点,从而暴露可解释的故障机制。我们的方法侧重于数学推理,并分两个阶段进行:首先,我们部署对抗性Agent,通过引入错误来改变一组声音证明,试图误导评审——换句话说,注入评审无法捕捉到的错误。然后,我们将这些尝试提炼成一小组突变策略,使我们能够分析评审的失败模式。为了确保这些策略不会过度适合初始证明集,我们通过将变异策略应用于保留的证明集并查询相同的评审来评估它们。我们在 GPT-5.6-sol 和 Claude Opus 5 上部署我们的方法,分别与它们的Agent协调器 Codex 和 Claude Code 配对。它们既可以用作引入错误的变异器,也可以用作评估数学推理正确性的判断器。我们发现,在所有 agentic 评审中,我们能够提炼出始终绕过他们的评估的突变策略,从而使我们能够确定可操作的故障模式。我们的分析还表明,判断的可靠性在前沿会下降:奥林匹克级别的证明或研究生级别的数学文本中的错误更容易被检测到,而研究级别的手稿中的缺陷更有可能逃脱检测。