论文

使用视觉语言模型进行图像分类的局部共形预测

Localized Conformal Prediction for Image Classification with Vision-Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

共形预测在不确定性量化领域引起了广泛关注,主要是因为它们具有强大的边际覆盖保证。完全的条件保证不是一个可以实现的目标,这是共形预测文献中众所周知的事实。因此,有几种方法尝试通过根据测试时间样本与校准示例的相似性来调整测试时间样本的保形集来近似这种行为。尽管后者已获得关注并在回归问题上显示出令人印象深刻的性能,但其在图像分类中的应用仍未得到充分探索。我们使用最近的本地化共形预测算法的开源实现,对视觉语言模型 (VLM) 的自然图像分类任务进行了广泛的基准测试。我们表明,直接使用测试时间和校准视觉特征之间的余弦相似度(VLM 的直观选择)不足以改进非局部基线。作为回应,我们提出了余弦相似度的简单非线性变换,它保留了边际覆盖保证并实现了统计上显着的平均集大小减小。代码可在 https://github.com/cfuchs2023/lcp-vlm/ 获取。