论文
Vinci2:在连续的第一人称的视频中提供主动帮助
Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos
摘要
智能助理什么时候应该在没有被询问的情况下说话?连续的第一人称的视频提供了丰富的、不断发展的背景,从而实现了一种新形式的帮助:一种主动的而不是仅仅被动的帮助。然而,现有的方法要么被动地等待用户查询,要么将每个检测到的事件视为需要响应,而不考虑用户的历史记录、当前活动,或者是否实际上会欢迎帮助。我们将主动协助重新定义为依赖于上下文的决策问题:代理不仅必须感知正在发生的事情,还必须根据累积的时间上下文进行推理,以确定何时以及是否进行干预。为此,我们推出了 Vinci2,这是一种主动的第一人称的辅助系统,可将设备上的助手 Vinci 从被动响应提升为主动响应。在评估方面,我们推出了 EgoServe,这是第一个针对连续自我中心视频主动协助的大型基准。 EgoServe 包含 3,000 多个服务实例,按照 4 个时间记忆范围组织,范围从即时安全警报到长期习惯指导,涵盖 10 个服务类别。在建模方面,我们提出了 EgoMemo,一种 无需训练 记忆增强代理,它维护三种互补的记忆表示:多尺度时间摘要、语义知识图和视觉嵌入档案。在每个时间步骤,EgoMemo 都会执行检索增强推理,以确定是否需要提供帮助,如果需要,则生成基于上下文的响应。实验表明,EgoMemo 在 EgoServe 上建立了强大的基准,同时在现有的第一人称的基准上保持竞争力。我们的基准测试和代码可在 \href{https://sitonggong.github.io/EgoServe-page/}{Vinci2} 公开获取。