论文
多模态 LLM 授权重新排名以实现可推广的人员重新识别
Multimodal LLM-Empowered Re-Ranking for Generalizable Person Re-Identification
摘要
领域通用 (DG) 人员重新识别 (Re-ID) 由于其在未见过的现实场景中部署的潜力而吸引了越来越多的研究兴趣。大多数现有方法通过专注于训练域通用编码器来解决 DG Re-ID,但忽略了推理阶段可能的改进。相比之下,这项工作探索了另一个方向,即改进推理重排序以增强 DG Re-ID。传统的重新排序方法通常依赖于基于邻域的距离来细化初始排序列表,本质上取决于 Re-ID 编码器产生的特征。然而,由于编码器缺乏足够的通用性来在未见过的场景中产生可靠的特征距离,因此它们在目标域上的性能恶化。受最近多模态 大语言模型 (MLLM) 卓越泛化能力的启发,我们提出了一种基于 MLLM 的距离度量来改进 DG Re-ID 中的重新排序。具体来说,我们首先通过受监督的 微调 使 MLLM 适应 Re-ID 数据,其中包含与域无关的提示和查询候选硬挖掘方案。然后,采用适应的 MLLM 在推理过程中计算 $μ$ 距离,这对域间隙具有鲁棒性,并显着增强后续的重新排序性能。我们的方法与模型无关,可以无缝集成到以前的重新排名框架中。大量实验表明,我们的方法在多个 DG Re-ID 基准测试中始终能带来显着的性能改进。本作品的代码即将在 https://github.com/RikoLi/MUSE 发布。