论文

CIAware-Bench:跨前沿LLM的控制干预意识基准

CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs

模型评测安全与风险评测

摘要

人工智能控制协议通过监控不可信模型的行为并修改潜在不安全的步骤来监督不可信模型,通常使用可信模型。这部分地篡改了不受信任模型的轨迹。如果可信模型检测到此类干预,它可以推断监视器的属性并进行调整以逃避控制。我们引入 \textbf{CIAware-Bench},这是一个衡量跨前沿模型 \textbf{c}ontrol \textbf{i}intervention (CI) 意识的基准。 CIAware-Bench 测试模型是否能够区分自己的轨迹与控制干预修改的轨迹。该基准测试由一组四个任务域(论文写作、BigCodeBench、Bash Arena 和 SHADE-Arena)组成,同时改变轨迹水印、副任务存在和控制协议。通过评估 11 个前沿模型,我们发现默认设置下的 CI 认知度为低到中等(高达 0.87;随机机会平衡二元分类精度为 0.5),任务域和模型对之间存在很大差异。跨模型系列的检测通常更容易,这表明模型利用了提供商在风格或训练后的特定差异。总的来说,CI 意识不是一个固定的模型级属性,应该针对每个新模型发布和部署场景进行测量。我们发布了 CIAware-Bench 来跟踪 CI 意识并通知控制协议,这些协议的干预措施很难被发现。

CIAware-Bench:跨前沿LLM的控制干预意识基准:论文配图
图 1:CIAware-Bench 概述。 (a) 作用模型生成多步轨迹,并且干预模型以(随机)步骤接管一步。 (b) 向行为模型显示一条(可能受到干预的)截断轨迹,并询问最后一步是否是由另一个模型编写的。我们报告二元分类的准确性。 (c) CIAware-Bench 跨越四个任务领域、多个变体(水印、辅助任务、替代协议),我们报告前沿模型的结果。