论文

EviRank:多模态图像重新排序的结构化相关性证据

EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking

模型推理推理验证与自校正

摘要

现实世界的图像搜索查询是多模式和组合的:“找到这件粉红色的衬衫”指定要保留的实体、要修改的属性和要忽略的上下文。然而,现有的重新排序器要么将这种多方面的相关性压缩为不透明的嵌入,要么依赖于自由形式的思想链,很容易忽略或产生细粒度的约束。借鉴 NLP 中基于标题和检查表的评估,我们将多模态图像重新排名重塑为语义约束满足问题,并提出 EviRank,它将任何查询(纯文本、纯图像或组合)解析为统一的证据包:跨六个语义槽(例如实体、属性、关系)的键入标准,每个槽都标记为必需、禁止或可忽略。然后,重新排名简化为以证据为条件的验证,在单个 无需训练 程序中结合确定性评分和基于证据的列表比较。明确的证据可以进一步作为结构化监督,选择性地提取轻量级学生。在涵盖文本到图像、图像到图像和合成图像检索的五个基准测试中,EviRank 实现了最先进的性能,并且经过精炼的学生以低得多的成本保留了教师 90% 以上的能力。