论文

用于终身人员重新识别的提示锚定视觉文本 蒸馏

Prompt-Anchored Vision-Text Distillation for Lifelong Person Re-identification

摘要

终身人员重新识别(LReID)旨在使用顺序收集的数据训练一个可推广的模型。然而,随着新领域的出现,此类模型常常会遇到语义漂移、适应性有限和灾难性遗忘的问题。现有的无范例方法在很大程度上依赖于仅视觉的 蒸馏 或参数正则化,同时忽略了辅助模式(例如文本)在保持语义稳定性和实现增量可塑性方面的潜力。我们观察到,预训练视觉语言模型中的冻结文本编码器可以作为跨领域的稳定语义锚。为了解耦视觉和文本的角色,我们提出了提示锚定视觉文本 蒸馏 (PAD),这是一种用于语义对齐和跨域泛化的非对称视觉文本框架。在文本方面,我们提炼提示以在固定的语义空间下保留视觉文本对齐,充当全局语义参考而不是主导学习信号。在视觉方面,基于 EMA 的教师具有自适应提示池,通过分配新的槽位同时冻结过去的槽位来实现域明智的适应。大量实验表明,PAD 在可见领域和未见领域的表现都远远优于最先进的方法,在稳定性和可塑性之间实现了强有力的平衡。项目页面位于 https://github.com/zu-zi/PAD。