论文

NEST:用于长视频理解的时间叙事事件结构

NEST: Narrative Event Structures in Time for Long Video Understanding

模型评测基准与评测资源

摘要

视觉语言模型的最新进展使得能够处理越来越长的视频序列,但是处理扩展的词元流并不能转化为理解长视频中复杂的叙事结构。现有的长视频基准侧重于大海捞针检索,而不是评估基础动作如何形成事件、跨时间交互和驱动叙事,例如,模型是否可以将早期失业与后来的关系破裂联系起来,尽管存在场景或闪回。我们引入了 NEST(用于长视频理解的叙事事件结构),这是一个包含 1,005 部完整长度的电影(平均 98 分钟)的数据集,每部都注释有约 103 个基于视觉内容、对话和音频的多模态叙事事件。 NEST 通过反映叙事结构的关系将这些事件联系起来,包括明确的时间顺序、层次结构和长期依赖关系。我们引入了事件触发检测(ETD)、事件定位(EL)、事件参数提取(EAE)和事件关系提取(ERE)的基线。该基准对于有视听证据依据的事件发现极具挑战性,在主要评估子集上评估的零样本模型的最佳性能仍然低于 ETD 的 8%、EL 的 6% 和 EAE 的 11%。相比之下,一旦给出事件,ERE 就更容易处理,在 微调 后达到 34.23% F1 零样本和 49.20% F1。