论文

自我视觉中的同伴式 QA 协助

Companion-style QA Assistance in Ego-Vision

模型评测基准与评测资源

摘要

人工智能伴侣被设想为永远在线的助手,为用户的日常生活提供支持。在这方面,我们引入了 BuddyVQA,这是针对以自我为中心的流视频的同伴式问答 (QA) 的基准。 BuddyVQA 包含 21,600 个问题,这些问题与 1,012 个以自我为中心的长视频中的 6K 个精彩时刻相关。它具有两个关键特征,这些特征在日常第一人称 QA 帮助中很常见,但在现有的 VideoQA 基准测试中很大程度上被忽视了:自我指示式表达和交互式连锁问题(例如,“它在哪里?”、“如何到达那里?”)。这些要求模型通过在以自我为中心的视觉和 QA 内容的背景下解析视觉代词来推断用户的情境意图,两者都基于长格式流媒体设置。为了应对这些挑战,我们提出了 MyBuddy,一种伴侣式的 QA 助手,它强调多模式的思想链推理机制,根据历史 QA 和视觉内容推断最终答案。额外的问题过滤器和多级内存旨在促进流式 QA 设置下的高效 QA 和视觉信息检索。实验表明,MyBuddy 显着增强了 BuddyVQA 上基础模型的性能。此外,这些收益可以推广到其他流媒体和常见视频 QA 基准,证明了我们方法的适用性和有效性。我们的代码和数据集可在 https://github.com/QHUni/BuddyVQA 获取