论文

使用分布外评分的零样本测试时间规范化

Zero-Shot Test-Time Canonicalization using Out-of-Distribution Scoring

模型推理测试时计算扩展

摘要

预训练的视觉模型经常会对旋转、缩放或剪切的输入进行错误分类,即使这些仿射变换使对象类保持不变。通常通过在架构中构建等变性或通过增强进行再训练来恢复鲁棒性,这两种方法都需要更改或重新训练模型。相反,测试时规范化使分类器保持不变。它取消每个输入的转换,在分类之前将其映射到接近训练分布的规范形式。然而,现有的标准化器依赖于一组狭窄的基于 logits 的能量评分和定制搜索程序,从而使评分函数和优化器的设计空间未被探索。我们将规范化重新定义为分布外 (OOD) 检测,这让任何 OOD 分数都可以充当转换过程中最小化的能量。在从手写字符和草图到自然图像和 3D 点云的基准测试中,我们系统地评估了大约 20 个 OOD 分数和 9 种搜索算法,发现基于距离的分数与随机搜索和局部细化相结合,总体表现最佳。由于规范化已经对齐的输入可能会损害准确性,因此我们添加了一种门控机制,仅当其 OOD 分数表明需要时才转换输入,从而保留大部分分布内准确性,同时保留转换后输入的鲁棒性增益。代码可在 github.com/johschm/its 获取。