论文

框架之间的阅读:解释社交媒体视频中的隐含和非字面含义

Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos

模型评测基准与评测资源

摘要

社交媒体视频传达的含义通常超出其可见的动作、标题或言论。只有通过多模态线索和文化背景的相互作用,平凡的剪辑才可能变得幽默、讽刺或讽刺,这使得此类内容成为视频语言模型的困难测试用例。在本文中,我们引入了 \textit{DrivelHub+},这是一个基准,用于评估模型是否可以推断社交媒体视频的隐式、非线性和修辞层次的含义,这些视频表面上看似无意义,但传达了有意的实用含义。 DrivelHub+ 包含从社交媒体收集的 1,000 个视频,每个视频都附有人工编写的隐含叙述解释。与专注于识别或描述的传统视频理解任务不同,我们提出了一个针对上下文多模态推理的基准。我们从两个角度评估当前的视频语言模型:解释,模型必须用自然语言解释视频的语用理解;和表示,我们采用推理即检索来测试模型表示是否在视频到文本和文本到视频检索中将视频与其相应的隐式叙述对齐。我们的基准测试提供了一个诊断设置,用于测量多模态感知和语用理解之间的差距,询问当前模型是否可以超越描述所显示的内容来推断其含义。