论文

BagDINO:用DINOv3适配多视角行李重识别

BagDINO: Multi-View Baggage Re-Identification with DINOv3

模型训练应用与实践参数高效训练视觉感知与空间理解

摘要

托运行李处理不当仍然是机场运营中经常出现的问题,当前的恢复工作流程仍然很大程度上依赖于基于标签的跟踪,当标签证据丢失或不可用时,该跟踪不直接支持视觉识别。本文将行李重新识别作为多摄像头设置中的实例级检索问题进行研究,利用 DINOv3 基础模型表示将查询图像与注册行李图像库进行匹配。 Torchreid 式的 BNNeck 重识别头放置在 DINOv3 主干的顶部,并通过 LoRA 执行参数高效的自适应。使用渐进式研究在 MVB 基准上进行实验,将完全冻结的骨干网与 LoRA 和微调策略进行比较。结果表明,基础模型特征的参数有效适应为有限训练数据下的多视图行李重新识别提供了一种有效且稳定的方法。

BagDINO:用DINOv3适配多视角行李重识别:论文原图
图 1:拟议行李重新识别流程概述。 DINOv3 ViT 主干提供全局图像表示(来自 [CLS] Token),并通过注入选定Transformer投影(例如 qkv、proj、fc1、fc2)的 LoRA 模块进行调整,同时保持预训练权重冻结。由此产生的嵌入由 Torchreid 风格的 BNNeck 头进行处理,并使用结合身份分类(带有标签平滑的交叉熵)和批量硬三元组损失的复合目标进行优化。在推理时,线性分类器被丢弃,并使用归一化嵌入(例如,余弦相似度)执行检索,以对给定查询的图库项目进行排名。