论文
模型作为工具:统一多模态视觉跟踪的代理协调框架
Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking
摘要
当前大多数视觉跟踪器采用专门针对跟踪数据集进行训练的基于匹配的架构,其性能增益在很大程度上取决于输入上下文的长度,并且现已达到瓶颈。虽然高性能跟踪越来越依赖于基础模型,但现有方法整体使用它们,将基础模型调整为跟踪器或将分段基础模型修改为跟踪管道,这无法利用互补优势。基于匹配的跟踪器在实例级对应方面表现出色,但缺乏语义辨别和细粒度的前景感知,而分割基础模型可以产生精确的掩模,但在实例辨别和多模态扩展方面存在困难。这两种范式还缺乏长期跟踪的纠错能力。为了解决这些问题,我们提出了 ACTrack,一种代理协调框架,它将异构模型视为事件触发机制下的可调用工具。 ACTrack 协调用于目标区分的基于跟踪器的实例匹配工具、用于掩模导出运动先验的 SAM3 运动工具、用于检测干扰物和实例冲突线索的 SAM3 感知工具,以及仅在持续冲突下激活的 VLM 重新提示工具,以减轻错误累积。我们设计了完整的工具调用触发机制和工具间协调机制,使不同模型工具的优势互补得到充分融合。实验表明,ACTrack 在八个 RGB 基准测试中大幅超越了最强和最大的跟踪器。此外,参数高效的适应策略可以实现跨工具的参数共享和重用,仅用 30% 的可训练参数即可实现统一的多模态跟踪,同时在 LasHeR、VisEvent、TNL2K 和 DepthTrack 等多模态基准上大幅优于现有方法。