论文
一个身份,多种角色:用于增强视频情境识别的多模态实体共指
One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition
摘要
视频情境识别 (VidSitu) 解决了视频中“谁对谁做了什么、用了什么、如何以及在何处”这一具有挑战性的问题。它通过要求识别多个事件中的事件角色的显着动作和相关简短描述来测试对视频的全面理解。 VidSitu 的基础需要跨镜头和不同外观的关键实体的时空定位。我们认为连贯的视频理解需要对扮演不同角色的实体进行一致的识别。我们提出多模态实体共指(MEC),将文本中的实体描述与视频中的基础结合起来。为此,我们引入了 CineMEC,这是一种多阶段方法,将事件角色提及组与实体的视觉集群联合起来,在训练期间无需明确的基础监督。我们的方法旨在利用视觉基础和字幕之间的协同作用,其中一个的改进会影响另一个,反之亦然。为了进行评估,我们使用基础注释扩展了 VidSitu 数据集。虽然之前的工作主要侧重于描述,但 CineMEC 提高了两者的一致性:字幕(+2.5% CIDEr,+7% LEA)和视觉基础(+18% HOTA)。