论文

LongEmo:走向长视频中的情感理解和推理

LongEmo: Towards Emotion Understanding and Reasoning in Long Videos

上下文与知识知识图谱

摘要

虽然最近的多模态大语言模型(MLLM)在情感计算方面显示出了前景,但它们的推理能力很大程度上局限于交互有限的短视频剪辑。然而,现实世界的情绪不仅仅是孤立的瞬时反应,而是由过去的经历和正在进行的事件深刻塑造的动态和累积的过程。为了弥补这一差距,我们引入了 LongEmoBench,这是一个致力于长视频中的情感理解和推理的基准。它评估从连续场景交互到复杂的情景开发的渐进能力。此外,我们提出了 LongEmo,一种新颖的记忆增强 Agentic 框架,旨在解决远程情感推理的巨大挑战。 LongEmo 处理连续视频流以构建事件记忆图,显式建模远程依赖性并捕获离散事件的情感动态。给定一个问题,Agent从图中检索与查询相关的事件流,迭代地集成多模态记忆和关系依赖关系以推断出最终答案。对 17 种代表性方法的广泛评估表明,它们在长视频中的情感理解和推理方面存在明显困难。相比之下,LongEmo 实现了最先进的性能,展示了其以事件为中心的内存架构的功效。