论文

使用 VLM 进行动态解析和更新自然语言规范以实现稳健的视觉语言跟踪

Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking

应用与实践视觉感知与空间理解

摘要

以自然语言规范为指导的视觉语言跟踪利用目标对象的高级语义线索来大幅提高跟踪准确性和鲁棒性。现有研究已经证实,在整个跟踪过程中自适应优化文本描述可以有效减轻由目标外观、位置和其他固有属性的动态变化引起的语义视觉失配。然而,通过序列模型或 大语言模型 直接生成文本信息的主流方法不可避免地存在固有缺陷,包括错误的目标更新、过度的背景干扰和普遍的幻觉伪像。为了解决上述局限性,本文提出了一种新颖的语言依存解析机制,以精确提取核心跟踪主成分,包括目标对象、语义概念和背景上下文信息。在此基础上,我们利用预训练视觉语言模型 Qwen-VL 强大的跨模态理解能力来执行组件感知的自适应文本描述更新。通过将所提出的精心设计的模块集成到基线框架中,我们的方法在多个大规模视觉语言跟踪基准(包括 TNL2K、LaSOT、TNLLT 和 OTB-LANG)上实现了一致且卓越的跟踪性能。源代码和预训练模型将在 https://github.com/Event-AHU/Open_VLTrack 发布。