论文
TACO:在视频识别中实现任务一致的开放词汇适应
TACO: Towards Task-Consistent Open-Vocabulary Adaptation in Video Recognition
摘要
将 CLIP 应用于开放词汇视频识别需要在新获得的视频知识和预训练的泛化之间取得微妙的平衡。虽然现有研究通过额外的正则化或约束来追求这种泛化-专业化权衡,但我们认为它们忽略了 微调 数据分布之外的表示偏差,从而导致了次优的适应效果。我们认为这种偏差是由于 微调 和评估目标之间的不一致而继承的,其中模型优化仅限于已知的训练分布,但在看不见的训练分布上进行评估。在本文中,我们引入了 \emph{TACO},这是一个简单而有效的框架,可以减轻这种不一致引起的潜在负面影响。我们的主要见解是,适应应该在训练分布之外保持与 OOD 相关的一致性。为此,我们提出\emph{相对结构蒸馏},它规范表示空间的相对几何形状并抑制训练期间有害的对齐偏移。我们通过轻量级专业化投影进一步将表示空间与优化空间解耦,允许特定于任务的适应,而无需直接过度专业化测试时使用的表示。 \emph{TACO} 在跨数据集和从基础到新颖的设置下在各种基准上建立了最先进的性能。代码将在 https://github.com/ZMHH-H/TACO 发布。