论文

通过视觉语言代理实现无目标域标签的跨域跟踪器适应

Cross-Domain Tracker Adaptation Without Target-Domain Labels via Vision-Language Agents

智能体系统Agent 架构与控制循环

摘要

我们提出了一个系统,该系统使用视觉语言模型(VLM)作为诊断代理,使检测跟踪管道适应新的目标域,而无需访问目标域标签。 VLM 不是针对带注释的指标进行优化,而是直接检查渲染的跟踪输出,识别视觉故障模式,并通过迭代调整循环建议参数更新。我们首先证明 真值 监督的超参数传输可能很脆弱。在 MOT17->MOT20 上,应用源自源的预言机配置将平均 HOTA 降低了 0.090,从目标域上限 0.357 降低到 0.267。在不使用任何目标域标签的情况下,我们基于 VLM 的调谐器恢复了 67.8% 的损失余量,在目标上限的 0.029 HOTA 内完成;在最高密度的目标序列上,它的恢复率高达 86.7%。我们进一步表明,具有手工制作的代理目标的无标签贝叶斯优化在大域转移下会遇到困难,并且可能会降低已经很强大的配置。相比之下,VLM 调谐器有选择性地起作用:当其视觉诊断没有显示出明确的故障模式时,它拒绝修改配置,保留简单传输的性能,同时改进困难传输的性能。最后,我们描述了这种方法成功的条件,即当域转移通过暴露的检测级参数表现出来时,与它效果较差的情况相比,例如 MOT17->DanceTrack,其中源预言机已经接近最佳。