论文
明显的故障:检测和修复上下文绑定错误
Legible Failures: Detecting and Repairing In-Context Binding Errors
摘要
错误的答案并不能表明模型是否缺乏所需的信息或保留了这些信息但未能使用它。在实体义务绑定任务中,语言模型可以发出错误的提示提供的绑定,而线性探针可以从其冻结的隐藏状态恢复正确的绑定。我们测量了 16 个公共检查点发生这种情况的频率,每个检查点都用三个种子进行评估。我们在训练折叠上安装探针,在验证折叠上选择其层,并在不相交的测试折叠上报告结果。在每个模型出错的试验中,探测精度超出了严格的现有义务基线 1/K = 0.125 +0.196(95% CI [+0.101, +0.296],通过模型引导)。查询实体反事实排除了词元的存在和新近度。根据探测输出不一致的符号构建的分数将模型自身置信度的故障检测提高了 +0.079 AUROC (95% CI [+0.036, +0.126])。与模型置信度相比,原始探针置信度没有提供可测量的改进。将残余流引导至探针解码的结合(不带金标记)可将测试的所有八个模型的准确度提高,平均值为+0.168(95% CI [+0.066,+0.280])。最近的研究报告称,探针检测到的错误难以干预,但我们发现上下文绑定是探针可操作的环境。