论文
重思证据深度学习中OOD检测的空泛性
Rethinking Vacuity for OOD Detection in Evidential Deep Learning
摘要
真空或不确定性质量 (UM) 通常用作评估证据深度学习 (EDL) 中分布外 (OOD) 检测的指标。它通常涉及将类别数量 ($K$) 除以模型预测的总置信度 ($S$),其中 $S$ 是通过对狄利克雷参数求和得出的。因此,UM 对 $K$ 的基数很敏感。特别是,在实践中,由于 EDL 的性质(抑制错误分配的证据),随着 $K$ 和 $S$ 的增加,$K$ 和 $S$ 之间不太可能存在线性关系。因此,在比较分布 (ID) 和 OOD 结果时,重要的是 $K_{\mathrm{ID}}$ 和 $K_{\mathrm{OOD}}$ 相等;在实践中并不总是能保证这一点。我们提供了一个实证演示,说明当 ID 和 OOD 之间的类基数相差 1 时,AUROC 和 AUPR 的结果如何存在显着差异,对于标准 EDL,AUROC 相差 0.318,AUPR 相差 0.613,对于 IB-EDL,AUROC 相差 0.360,AUPR 相差 0.683。更具体地说,我们的研究结果隔离了一个评估假象:当 ID 和 OOD 之间的 K 不同时,AUROC/AUPR 可以人为地夸大,而模型预测不会发生任何变化。我们进一步讨论使用多项选择问答 (MCQA) 数据集对 EDL 对因果语言模型的评估,并主张在此背景下对 ID 和 OOD 进行更清晰的定义。我们的主要贡献是实证和理论证明,EDL 微调的 LLM 中基于真空的 OOD 检测对评估类基数中不受控制的差异高度敏感。