论文
当模型知道自己不知道时:校准、级联与清洗
When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning
摘要
当模型知道自己不知道时,许多可能性随之而来。第一个问题是如何让模型识别自己不知道。一个有前景的方法是使用从模型内部信号计算的置信度来反映其无知。特定领域的先前工作表明,校准能提供可靠的置信度估计。在这项工作中,我们提出一个简单、有效且通用的免训练方法,适用于视觉与语言模型,执行模型校准、级联与数据清洗,以更好地利用模型识别自己不知道的能力。我们首先强调两个关键实证观察:在单个模型内,更高置信度对应更高准确率;在验证集上校准的模型在留出测试集上仍保持校准。这些发现从实证上确立了校准置信度的可靠性与可比性。在此基础上,我们引入两个应用:(1)带校准优势路由的模型级联;(2)基于模型集成的数据清洗。利用由校准置信度可比性导出的路由信号,我们级联大小模型以提升效率且几乎不牺牲准确率,并进一步级联两个规模相近的模型以获得超越任一单模型的性能。利用多个专家及其校准置信度,我们设计了一个简单而有效的数据清洗方法,在精度与检出率之间取得平衡,识别ImageNet与Massive Multitask Language Understanding(MMLU)数据集中的错标样本。我们的结果表明,让模型识别自己不知道,是迈向更高效、可靠、可信AI的实用一步。