论文

Commit-first LLM 判断继承了判断者自身的错误

Commit-first LLM judging inherits the judge's own errors

模型评测安全与风险评测

摘要

LLM 判断,对另一个系统的输出进行评分的模型可以通过它们评分的系统进行游戏。最近的工作确定了一种有效的防御措施:法官首先解决任务本身并承诺该答案,然后仅在两者匹配时才接受候选人。我们称之为提交优先判断,并询问已发布的软件是否实现了它,以及它的成本是多少。我们审核了八个广泛使用的评估框架的默认法官配置。在范围内的 24 个配置中,没有一个配置实现它。九个实现了一种被文献测量为无效的变体,并且共享一个祖先提示,可以通过复制的印刷错误进行追踪。在受控实验中,无法获得正确答案的普通 N 最佳搜索会根据这些配置之一优化代码,完全按照文档使用。在一项区间合并任务中,评委在一颗种子中接受了 96 名候选人中的 90 名,在另一颗种子中接受了 96 名候选人中的 93 名;每个被录取的候选人都通过了搜索可以看到的所有测试,并未能通过它无法看到的保留套件。法官确定了有缺陷的线路,并将其作为满分的理由。提交优先判断消除了效果:两个种子中的 0 为 96。在第二个任务中,这使得两个种子的情况都变得更糟:法官所承诺的答案是错误的,而在一个种子中,人们聚集在它上面。这是我们的主要发现。提交优先的判断并不会消除被玩弄的锚,而是将其从候选人转移到法官自己的答案上,因此评估只有在法官完成任务时才有效。这个前提条件很容易提前衡量,并且是任务局部的而不是规模依赖的:较小的法官解决了前沿法官失败的任务,并抵制在它没有做到的地方博弈。我们还验证了我们自己的工具:我们的标准中的十五个声明中有五个与逐字来源相比是错误的,并且两个保留的检查根据其规范是不合理的。