论文

全局平均精度:让表示分数可跨查询比较

Global Average Precision for Representation Learning

模型训练模型评测预训练评测方法与指标模型行为与机制分析

摘要

标准信息检索指标(例如平均精度 (mAP))根据查询及其正项与负项之间的相似性进行比较,一次评估一个查询的性能。这同样适用于常见的表示学习损失,例如 InfoNCE 和每个查询的 AP 代理。他们都没有考虑跨查询的相似性是否具有可比性,而任何具有单一决策阈值的系统都依赖于查询。全局平均精度 (gAP) 通过对一个列表中的所有查询-候选对进行排名并计算单个 AP 来实现这一点。我们引入 gSAP,gAP 的可微分替代品。它只需要一个相似性矩阵和一个标记正对的二进制矩阵,与现有损失相同的输入,因此它是它们的直接替代品,并且与编码器、模态和监督源无关。由于它联合考虑了批次中所有可能的成对比较,因此它在低温下仍然可训练,在这种情况下,每个查询的代理都会耗尽梯度。将其替换为既定配方可改善监督 度量学习、跨模态对齐和自监督预训练,据我们所知,它是后两者中第一个取代社区标准 InfoNCE 的排名损失。它的相似性在各个查询中更加一致,这将收益推向通用阈值以下。在相同精度下,gSAP 检索的正对数量最多是最强 AP 代理的四倍,并且当添加数据库中没有正项的查询时,其性能下降最少。除了阈值处理之外,使用 gSAP 训练的模型还可以学习更好的表示,具有更高的传输、$k$NN 和零样本分类精度。