论文
用于引用单目标跟踪的高效语言到视觉特征注入
Efficient Language-to-Vision Feature Injection for Referring Single-Object Tracking
摘要
引用单对象跟踪通过联合利用语义线索和视觉模板来实现基于语言的目标初始化和后续跟踪。核心难点在于跨阶段不同地使用语言:它对于基础是必不可少的,但如果过分强调,可能会在跟踪过程中引起语义漂移。同时,当前的方法通常需要昂贵的视觉语言对齐训练。我们提出了 LVTrack,一个纯粹的 Transformer 框架,它引入了模式调节的门控特征注入器来自适应地调节文本指导并减轻语义漂移。结合有针对性的适应,它直接利用冻结的视觉语言预训练模型,大大降低了训练成本并保持了强大的语言理解。为了进一步改进时间定位,LVTrack 将混合相对绝对位置编码与轻量级内存机制集成,并使用高斯平滑 KL 损失优化自回归框预测。标准基准测试的大量实验表明 LVTrack 具有强大的性能。