论文

ReferTrack:针对具体视觉跟踪的引用然后跟踪

ReferTrack: Referring Then Tracking for Embodied Visual Tracking

模型评测模型行为与机制分析

摘要

体现视觉跟踪(EVT)要求移动代理仅使用机载视觉连续跟踪以自然语言描述的特定目标。虽然最近的视觉-语言-动作(VLA)策略统一了目标识别和轨迹规划,但它们的思想链(CoT)推理通常在抽象的空间潜伏中运行,这些潜伏难以监督,并且与显式图像空间检测的一致性较弱。为了解决这个问题,我们引入了 ReferTrack,这是一种先参考后跟踪的范例,它使用单个前置摄像头来实现 EVT。我们的模型首先从一组索引的边界框中选择目标,然后根据该基于图像的决策解码跟踪路径点。为了随着时间的推移保留目标运动线索,ReferTrack 维护先前选择的边界框的滑动窗口队列,通过时间视点 bbox 指示器 (TVBI) 标记将其几何特征注入视觉历史记录。我们通过在自定义 Refer-QA 数据集上进行联合训练来进一步增强目标识别。在 EVT-Bench 上,ReferTrack 实现了最先进的单视图性能,在单目标、分散注意力和模糊性跟踪分割上的成功率分别为 89.4%、73.3% 和 74.1%,在识别繁重的任务上匹配甚至超过了多个多摄像头基线。最后,在腿式和人形机器人上的实际部署验证了其强大的模拟到真实传输能力。代码可在 https://github.com/MedlarTea/referTrack 获取。