论文
AffectSeek:模糊用户查询下长视频的代理情感理解
AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries
摘要
现有的情感理解研究主要集中在从图像、音频信号或预先剪辑的视频剪辑中识别情感,其中情感证据已经给出。这种被动的、以剪辑为中心的设置并不能完全反映现实场景,用户经常与长视频交互并通过自然语言查询表达他们的需求。在本文中,我们研究了 \textbf{模糊查询驱动的视频情感理解(VQAU)},这是一项新任务,需要模型定位长视频中的情感时刻,预测其情感类别,并在模糊的用户查询下生成基于证据的基本原理。为了支持这项任务,我们构建了 \textbf{VQAU-Bench},这是一个将长视频、模糊情感查询、时间剪辑注释、情感标签和基本原理解释集成到统一评估框架中的基准。 VQAU-Bench 能够对语义-时间-情感对齐、情感时刻定位、情感分类和基本原理生成进行系统评估。为了解决 VQAU 的多步推理挑战,我们进一步提出 \textbf{AffectSeek},一种主动寻找、验证和解释长视频中情感时刻的代理框架。 AffectSeek将VQAU分解为意图解释、候选定位、剪辑验证、情感推理和理由生成,并通过角色专业推理和跨阶段验证逐步将模糊的用户意图与长视频证据对齐。实验表明,VQAU 对于现有的情感识别模型和单步视觉语言模型仍然具有挑战性,而 AffectSeek 为代理长视频情感理解提供了一个简单而有效的框架。