论文

通过校准交互解决组合图像检索中的歧义

Resolving Ambiguity in Composed Image Retrieval via Calibrated Interaction

摘要

组合图像检索 (CIR) 使用参考图像和描述如何修改它的文本来搜索语料库。尽管从三元组训练的合成器到零样本和生成方法取得了快速进展,但基本上所有系统都共享一个假设:查询映射到单个目标,由 Recall@K 针对一个注释进行评分。我们认为这从根本上与任务相矛盾。诸如“使它更正式”之类的查询不会命名图像,而是命名语料库的一个区域,并且用户想要哪个成员确实不确定。这种指定不足是众所周知的假阴性问题的根源,并使当前模型无法区分精确的查询和模糊的查询。我们将 CIR 重新定义为不确定性下的校准意图解析:检索器 被包裹在共形预测层中,该预测层返回具有覆盖保证的候选集,其大小是模糊性的原则度量;当集合很大时,预期信息增益策略会从可解释的模糊轴和集合契约中提出一个最有用的澄清问题。我们推出了 AmbiCIR,这是一个基准和经过人类验证的用户模拟器,它恢复了 CIRR 休眠的辅助和对话注释,并扩展了 CIRCO 的多重正向设置。在开放域和时尚基准测试中,我们的方法与单轮最先进的技术相匹配,确认校准分辨率在精确查询上是免费的,同时以朴素对话基线所需的交互预算的一小部分达到预期目标,并且它是第一个报告任务的有效覆盖和校准的方法。