论文

USS:统一空间语义提示以实现端到端的具体视觉跟踪

USS: Unifying Spatial-Semantic Prompting for End to End Embodied Visual Tracking

摘要

体现视觉跟踪(EVT)要求代理在动态环境中移动时持续跟踪指定目标。现有的具体跟踪方法通常依赖于隐式目标选择约定或语言描述,而目标规范接口很大程度上是固定的。然而,不同的跟踪场景自然有利于不同形式的目标指定:语言可以指定机器人当前视图之外的目标,而空间提示为可见目标提供直接实例指定,并且可用于在相似的人中进行选择、指定难以描述的个体或在时间压力下指定目标。因此,我们为 EVT 引入了统一的空间语义提示,其中文本、点、框和掩模作为补充目标规范,可以根据不同的场景进行选择,并提出 USS,一种将其中任何一个映射到以自我为中心的路径点的端到端架构。特定于模态的提示编码器提供一种通用设计,包括混合注意融合、时间记忆、跨视图聚合、潜在预测和路点解码,并在相同的配方下为每个接口训练一个策略实例。在 320 个仅在模拟中训练策略的零样本真实机器人试验中,空间提示的表现与普通跟踪场景中的语言相当,同时在视觉上相似的目标需要精确的实例指定时提供明显的好处,支持我们的假设,即不同的场景有利于不同的目标规范。在标准语言提示协议下的模拟 EVT-Bench 上,USS 在 57 FPS 下获得了非 MLLM 方法中最高的成功率,而 MLLM 跟踪器报告的 4.8-10 FPS 在多个指标上都更强。项目站点:https://arescheah.github.io/uss-project-page/。