论文

EvalDetectBench:衡量前沿语言模型评测感知能力的基准

EvalDetectBench: A Benchmark for Measuring Evaluation Awareness in Frontier Language Models

模型评测基准与评测资源

摘要

前沿大语言模型通常可以在评估时进行识别,这种能力称为评估意识。如果模型在评估中的表现与在部署中的表现不同,就会破坏评估结果的有效性,而评估结果是当前人工智能安全框架的重要组成部分。我们推出了 EvalDetectBench,这是一个开放式管道和基准,用于测量评估意识,可与任何 Inspect 兼容的评估配合使用,允许从业者根据当前和未来的基准进行测试。 EvalDetectBench 附带了一个新策划的转录套件,涵盖当前前沿系统卡评估和不同的部署源。该基准有两个目的:衡量前沿LLM认识到他们正在接受评估的可靠性,以及评估单个基准作为评估的可检测性。我们在现有文献中确定了两种引入系统偏差的方法选择:生成部署记录的模型的身份占测量方差的 11.25%,并且可以重新排序模型排名;在一种模型上为高性能而选择的启发提示在其他模型上也有可能表现良好。 EvalDetectBench 通过每个模型的探头校准和分层发生器协调程序进行校正。

EvalDetectBench:衡量前沿语言模型评测感知能力的基准:论文配图
图1:Eval检测基地方法概览。(a) 管道结构。(b) 在三个部署数据条件下,AUROC:只使用自己(无根据参考)、混用(混合各种生成器模型部署数据)和纠正。(c) 每个模型都调查问题选择。