论文
SnapBench:移动交互的 Snap-and-Ask 多模态检索基准测试
SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions
摘要
移动人工智能充当视觉神谕,使用户能够拍摄某物的照片并询问信息。 “即拍即问”检索现在是移动人工智能最常见的切入点之一,但照片通常很模糊,而文本问题可能很短或输入错误。现有的基准测试仅测试干净的输入,或者不隔离快速检索中的配对稳健性。因此,我们引入了 SnapBench,这是第一个用于稳健的“快照-询问”多模式检索的配对基准,涵盖 1,145 个查询、53 个受控损坏条件下的 9,085 个图库项目,并带有人工注释。我们评估了 16 个多模态 检索器,涵盖双塔编码器和基于嵌入的 VLM。结果表明,图像损坏极大地降低了检索性能,而文本损坏主要影响纯文本检索,对联合检索影响有限。干净的纯图像检索通常优于联合检索,这表明粗文本拖动和在噪声输入下缺乏跨模式回退。 SnapBench 提供了一个受控测试平台,用于评估“即插即用”场景中的稳健检索。我们进一步提出了 MOOR(模态锚定、离群值感知、最佳重新加权),这是一种简单的自适应融合方法,强调了在快速检索中进行可靠性感知模态校准的必要性。