论文
一次扰动是不够的:行为人工智能评估的可识别性和盲基线
One Perturbation Is Not Enough: Identifiability and Blind Baselines for Behavioral AI Evaluation
摘要
行为评估扰乱输入并读取输出中引起的变化,以证明系统使用该输入。我们表明,此类证书所需的扰动数量是固定的,并且报告单个扰动无法提供它。如果响应比是策略的属性而不是测试项目的属性,则行为记录是指数向量的线性测量,记录输出对每个输入的依赖程度,因此扰动在其对数跨越输入空间时准确地识别输入使用。 $n$ 输入至少需要 $n$,不完整的设计会精确地混淆沿其设计矩阵核心不同的策略,并且锐化扰动永远不会替代添加独立的扰动。我们还以封闭形式得出这样的测试授予一项什么也不读取的策略的分数,该分数远非零,而且我们调查的任何探测器都没有报告该分数。通过维度分析来确定正确响应的实例化,我们对报告视频中物理量的三个视觉语言模型运行一组完整的三个扰动识别集。所有三个分数都远低于自己的盲界,而不是高于它,因为每个都默认为一小组圆形校准值中的一个,而这些值与比例所断言的不匹配;没有一个将其重新标记响应移动单个指数,并且没有一个与指示忽略视频的同一模型是可分离的。