论文

分解和衡量评估意识

Decomposing and Measuring Evaluation Awareness

模型评测基准与评测资源

摘要

前沿语言模型有时会认识到它们正在接受评估并调整其行为,这可能会破坏基准结果的有效性。然而,该领域的研究没有共同的基础,将评估的缺陷与模型的功能混为一谈,并将检测与行为反应混为一谈。我们将评价意识植根于社会心理学,将其分解为环境成分和将认知与倾向分开的模型成分。我们通过八个分类触发因素(例如占位符实体和分级式输出格式)来操作环境组件,并通过思想链监控来研究识别和行为。在九个前沿模型和四个基准中,识别率取决于模型和基准的特定配对。认可很少与行为改变联系在一起,即使联系在一起,方向也取决于所感知到的评价类型。模型对安全性也比能力评估更敏感,这使得安全基准的有效性面临更大的风险。为了研究每个模型对哪些因素敏感以及它们如何相互作用,我们提出 \textbf{EvalAwareBench},这是一个包含 100 个配对安全能力任务的因素控制基准,其中八个因素中的每一个都可以独立切换,在保持底层请求固定的同时改变评估信号。通过 EvalAwareBench,我们发现没有一个因素会统一影响所有模型,但叠加因素会逐渐提高所有模型的评估意识。我们的框架和 EvalAwareBench 提供了测量、归因和减轻评估意识的工具,为未来的解决方案奠定了基础。