论文

使用开源视觉语言模型进行杂货产品检索的重要因素

What Matters for Grocery Product Retrieval with Open Source Vision Language Models

模型评测模型能力评测

摘要

多模式产品检索 (MPR) 支撑着免结账零售和自动库存系统,但它需要细粒度的 SKU 区分,而标准视觉语言基准无法捕捉到。我们在 GroceryVision Challenge 的 MPR 任务中首次对 190 个开源 VLM 进行了系统的零样本评估,隔离了 预训练 数据、架构和输入分辨率。我们的分析得出了三个可行的发现。 \textbf{(1) 数据质量胜过规模。}从原始网络抓取切换到过滤后的数据集可实现高达 16.6% 的准确度增益,超过了模型参数加倍所带来的好处。 \textbf{(2) 高效的模型可以获胜。}MobileCLIP-B(150M 参数)优于在噪声数据上训练的 351M 模型。我们引入 \textit{语义功率密度} ($φ$),这是一种惩罚亚阈值精度的效率指标。 \textbf{(3) 精度差距仍然存在。}最先进的模型实现了 94.5\% Recall@5,但在 Recall@1 时下降了 17.5\%,这表明对比嵌入可以有效地聚类类别,但无法对视觉上相似的 SKU 进行排名。代码和评估脚本可在 \url{https://github.com/upeee/openmpr} 获取。