论文

ARGOS:代理多摄像机人员搜索中的人物、地点和时间

ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search

智能体系统Agent任务评测

摘要

现有的人员搜索方法假设可以访问完整的视觉查询或详尽的跟踪,但现实世界的目击者叙述是模糊的、片面的,并且分散在摄像机和时间中。我们介绍了 ARGOS(基于观察搜索的代理检索),这是一种基准和代理框架,它将多摄像头人物搜索从完整查询的一次性检索重新转换为根据部分线索进行交互式推理。据我们所知,ARGOS 是第一个将目击者对话与摄像头网络拓扑相结合的交互式基准,要求代理在信息不对称的情况下进行计划、提问和消除。 ARGOS Agent收到模糊的证人陈述,必须决定要问什么、何时调用空间或时间工具以及如何解释模糊的自然语言响应,所有这些都在有限的回合预算内。为了在物理约束下进行地面推理,代理访问时空拓扑图(STTG),编码摄像机连接性和经经验验证的转换时间。该基准测试包括 14 个现实世界场景中的 2{,}691 个任务,分为三个渐进轨道:语义感知(\emph{Who},989 个任务)、空间推理(\emph{Where},550 个任务)和时间推理(\emph{When},1{,}152 个任务)。我们建议将回合加权成功(TWS)作为主要指标,共同衡量正确性和回合效率。对四个 LLM 主干网的实验表明,基准远未解决:最佳代理的 TWS 达到 0.383 (Track~2) 和 0.590 (Track~3)。消融确认每个组件都是必不可少的:删除特定领域的工具会使 Top-1 的准确性下降高达 49.6 个百分点,而删除战略推理则使 TWS 减半,而几乎不影响 Top-1。