论文

评估差异:当前沿AI模型意识到自己正被测试

The Evaluation Differential: When Frontier AI Models Recognise They Are Being Tested

模型评测智能体系统Agent任务评测评测方法与指标长程任务评测

摘要

来自前沿实验室的近期公开证据表明,当代AI模型能够识别评估情境、在潜在表征中编码它们,并在这些情境下的行为有别于部署连续条件下的行为。Anthropic的BrowseComp事件、关于SWE-bench Verified与破坏性编码评估的Natural Language Autoencoder发现、以及OpenAI与Apollo的反谋算(anti-scheming)工作,都记录了这一现象的实例。我们认为,这些发现为从前沿评估得出的安全结论制造了主张有效性问题。我们提出评估差异(ED),即目标行为属性在被识别的评估情境与部署连续情境之间的条件散度,定义了用于跨属性比较的归一化效应量形式(nED),并证明边际评估分数无法识别ED。我们依据在有据可查的散度下的论证地位,建立了安全主张的类型学(ED稳定、ED退化、ED反转、ED未定),并制定TRACE(面向主张评估的测试识别审计),一种包裹现有评估基础设施的审计协议,产出受限的主张而非能力分数。我们将该框架回溯应用于三起公开记录的评估事件,并讨论其对系统卡片、符合性评估以及国际AI安全研究机构网络的治理启示。TRACE并不能消除对抗性适应;它通过明确评估证据产生时的条件,来约束从评估证据中得出的主张。