论文
IntentQA:通过认知上下文推理在视频中进行意图问答
IntentQA: Intent Question Answering in Videos by Cognitive Context Reasoning
摘要
视频理解要求智能代理超越对视觉事实的单纯识别,并理解人类行为背后的潜在意图(通常被称为社会智能的“暗物质”)。为了弥合视觉观察和意图推理之间的差距,我们引入了一项新任务 IntentQA,并贡献了专门为此目的定制的大规模 VideoQA 数据集。然而,认识到标准指标可能会因数据集偏差而高估能力,我们超越简单的准确性来严格评估模型的稳健性。我们通过 大语言模型 (LLM) 生成五个不同的对比度集并引入“对比度性能下降”指标来增强基准。我们提出了 X-CaVIR(eXplainable 上下文感知视频意图推理)框架,它利用三种类型的“认知上下文”来增强视频分析:i)通过跨模态视频查询语言(VQL)模块的情境上下文,ii)通过对比学习模块的对比上下文,以及 iii)通过常识推理模块的常识上下文。至关重要的是,为了克服传统黑盒模型的不透明性,我们通过采用透明管道将视频字幕与 VQA 模型输出相协同,改进了 LLM 在 X-CaVIR 中的集成。这种方法不仅通过有效利用丰富的常识知识来提高性能,而且使推理过程变得明确可解释。大量的实验证明了我们组件的有效性、X-CaVIR 相对于最先进基线的优越性,以及它对对比组扰动的稳定性。